Agenten-Benchmarks

SWE-bench Verified Agenten-Benchmark

OpenGPT hält 10 veröffentlichte Zeilen mit der unten gezeigten exakten Benchmark-Version SWE-bench Verified und Umgebung verknüpft.

Aufgaben
500
Veröffentlichte Zeilen
10
Datum der Quelldaten
Identität geprüft
Historisch

Nachweisumfang

Verified · Top 10 published configurations · 500 tasks. human-validated GitHub issues. Reproducible repository environments evaluated durch the upstream benchmark. Configuration-specific upstream limits.

How OpenGPT handles this evidence

OpenGPT bewahrt Kennzahl, Aufgabenumfang, Umgebung, Version, Konfigurationsfelder und Quelldatum des Herausgebers. Es erstellt keine Benchmark-übergreifende Agent-Gesamtpunktzahl.

Vergleichsgrenzen

  • Ein höheres Ergebnis gilt nur für die angezeigte Benchmark-Version und die entsprechenden Bedingungen.
  • Die Ergebnisse der Agenten spiegeln das Gesamtsystem wider, nicht nur das Basismodell.
  • Fehlende Daten zu Kosten, Zuverlässigkeit, Sicherheit oder Latenz werden weiterhin als nicht gemeldet ausgewiesen und nicht abgeleitet.
  • Bewahren Sie diese veröffentlichten Ergebnisse als historische Nachweise auf, nicht als aktuellen universellen Maßstab für Coding-Fähigkeiten. Eine OpenAI-Prüfung von 2026 berichtete über grundlegende Bedenken hinsichtlich Design und Kontamination bei SWE-bench Verified.

Verified · Top 10 published configurations · 500 Aufgaben

10 von 10 veröffentlichten Zeilen werden angezeigt. Jedes Ergebnis bleibt mit dem Quellbenchmark und der Konfiguration verknüpft.

  1. live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC · Claude 4.5 Opus medium (20251101)#1Resolved: 79.2%live-SWE-agent
  2. Sonar Foundation Agent + Claude 4.5 OpusSonar · Claude 4.5 Opus#1Resolved: 79.2%Sonar Foundation Agent
  3. TRAE + Doubao-Seed-CodeByteDance · Doubao-Seed-Code + Doubao-Seed-1.6#3Resolved: 78.8%TRAE
  4. live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC · Gemini 3 Pro Preview (2025-11-18)#4Resolved: 77.4%live-SWE-agent
  5. Atlassian Rovo Dev (2025-09-02)Atlassian · Claude Sonnet 4 + GPT-5#5Resolved: 76.8%Atlassian Rovo Dev
  6. EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems · Claude 4 Sonnet#5Resolved: 76.8%EPAM AI/Run Developer Agent
  7. mini-SWE-agent + Claude 4.5 Opus (high reasoning)SWE-agent · Claude 4.5 Opus (high reasoning)#5Resolved: 76.8%mini-SWE-agent
  8. ACoderACoder · Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro#8Resolved: 76.4%ACoder
  9. mini-SWE-agent + Gemini 3 Flash (high reasoning)SWE-agent · Gemini 3 Flash (high reasoning)#9Resolved: 75.8%mini-SWE-agent
  10. mini-SWE-agent + MiniMax M2.5 (high reasoning)SWE-agent · MiniMax M2.5 (high reasoning)#9Resolved: 75.8%mini-SWE-agent