Agent 評測
SWE-bench Verified Agent 評測
OpenGPT 將10筆公開記錄保留在下方所示的 SWE-bench Verified 評測版本與環境內。
- 工作
- 500
- 公開記錄
- 10
- 來源資料日期
- 身分核驗日期
- 歷史記錄
資料範圍
Verified · Top 10 published configurations · 500 tasks. human-validated GitHub issues. Reproducible repository environments evaluated by the upstream benchmark. Configuration-specific upstream limits.
OpenGPT 如何處理這些資料
OpenGPT 保留發布方的指標、工作範圍、環境、版本、設定欄位與資料日期,不產生跨評測 Agent 總分。
可比範圍
- 更高結果只適用於所展示的評測版本與條件。
- Agent 結果反映完整系統,而不是基礎模型單獨能力。
- 成本、穩定性、安全性或速度沒有公開時保持未報告,不進行推測。
- Keep these published results as historical evidence, not a current universal measure of coding ability. A 2026 OpenAI audit reported fundamental design and contamination concerns in SWE-bench Verified.
Verified · Top 10 published configurations · 500 tasks
展示10筆公開記錄中的10筆;每項結果都保留來源評測與設定。
- live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC · Claude 4.5 Opus medium (20251101)#1Resolved: 79.2%live-SWE-agent
- Sonar Foundation Agent + Claude 4.5 OpusSonar · Claude 4.5 Opus#1Resolved: 79.2%Sonar Foundation Agent
- TRAE + Doubao-Seed-CodeByteDance · Doubao-Seed-Code + Doubao-Seed-1.6#3Resolved: 78.8%TRAE
- live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC · Gemini 3 Pro Preview (2025-11-18)#4Resolved: 77.4%live-SWE-agent
- Atlassian Rovo Dev (2025-09-02)Atlassian · Claude Sonnet 4 + GPT-5#5Resolved: 76.8%Atlassian Rovo Dev
- EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems · Claude 4 Sonnet#5Resolved: 76.8%EPAM AI/Run Developer Agent
- mini-SWE-agent + Claude 4.5 Opus (high reasoning)SWE-agent · Claude 4.5 Opus (high reasoning)#5Resolved: 76.8%mini-SWE-agent
- ACoderACoder · Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro#8Resolved: 76.4%ACoder
- mini-SWE-agent + Gemini 3 Flash (high reasoning)SWE-agent · Gemini 3 Flash (high reasoning)#9Resolved: 75.8%mini-SWE-agent
- mini-SWE-agent + MiniMax M2.5 (high reasoning)SWE-agent · MiniMax M2.5 (high reasoning)#9Resolved: 75.8%mini-SWE-agent