Agent-benchmarks

SWE-bench Verified agent-benchmark

OpenGPT houdt 10 gepubliceerde rijen gekoppeld aan de exacte SWE-bench Verified-benchmarkversie en hieronder weergegeven omgeving.

Taken
500
Gepubliceerde rijen
10
Datum van brongegevens
Identiteit beoordeeld
Historisch

Bewijsbereik

Verified · Top 10 published configurations · 500 tasks. human-validated GitHub issues. Reproducible repository environments evaluated door the upstream benchmark. Configuration-specific upstream limits.

How OpenGPT handles this evidence

OpenGPT behoudt de meetwaarde, het taakbereik, de omgeving, versie, configuratievelden en brondatum van de uitgever. Het maakt geen algehele Agent-score over benchmarks heen.

Vergelijkingsgrenzen

  • Een hoger resultaat geldt alleen voor de weergegeven benchmarkversie en de bijbehorende voorwaarden.
  • Agentresultaten weerspiegelen het volledige systeem, niet alleen het basismodel.
  • Ontbrekende gegevens over kosten, betrouwbaarheid, veiligheid of latentie worden niet afgeleid maar blijven niet-gerapporteerd.
  • Bewaar deze gepubliceerde resultaten als Historisch bewijs, niet als Actuele universele maatstaf voor programmeervaardigheid. Een OpenAI-audit uit 2026 meldde fundamentele zorgen over het ontwerp en contaminatie in SWE-bench Verified.

Verified · Top 10 published configurations · 500 taken

10 van 10 gepubliceerde rijen weergegeven. Elk resultaat blijft gekoppeld aan de bronbenchmark en configuratie.

  1. live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC · Claude 4.5 Opus medium (20251101)#1Resolved: 79.2%live-SWE-agent
  2. Sonar Foundation Agent + Claude 4.5 OpusSonar · Claude 4.5 Opus#1Resolved: 79.2%Sonar Foundation Agent
  3. TRAE + Doubao-Seed-CodeByteDance · Doubao-Seed-Code + Doubao-Seed-1.6#3Resolved: 78.8%TRAE
  4. live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC · Gemini 3 Pro Preview (2025-11-18)#4Resolved: 77.4%live-SWE-agent
  5. Atlassian Rovo Dev (2025-09-02)Atlassian · Claude Sonnet 4 + GPT-5#5Resolved: 76.8%Atlassian Rovo Dev
  6. EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems · Claude 4 Sonnet#5Resolved: 76.8%EPAM AI/Run Developer Agent
  7. mini-SWE-agent + Claude 4.5 Opus (high reasoning)SWE-agent · Claude 4.5 Opus (high reasoning)#5Resolved: 76.8%mini-SWE-agent
  8. ACoderACoder · Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro#8Resolved: 76.4%ACoder
  9. mini-SWE-agent + Gemini 3 Flash (high reasoning)SWE-agent · Gemini 3 Flash (high reasoning)#9Resolved: 75.8%mini-SWE-agent
  10. mini-SWE-agent + MiniMax M2.5 (high reasoning)SWE-agent · MiniMax M2.5 (high reasoning)#9Resolved: 75.8%mini-SWE-agent