66 個Agent系統74 筆Agent評測配置109 筆BFCL工具呼叫模型結果8 評測範圍
收錄僅確認公開身分與官方入口,不代表效能排名或推薦;下方榜單只顯示同範圍的公開評測證據。
Atlassian Rovo DevAtlassian
Agent產品商業產品
來源核驗:
Augment AgentAugment Code
Agent產品商業產品
來源可存取
來源核驗:
Claude CodeAnthropic
Agent產品商業產品
來源核驗:
ClineCline Bot
開源Agent
來源可存取
來源核驗:
CodebuffCodebuffAI
開源Agent
來源可存取
來源核驗:
Cursor AgentAnysphere
Agent產品商業產品
來源可存取
來源核驗:
DevinCognition
Agent產品商業產品
來源可存取
來源核驗:
Factory DroidFactory
Agent產品商業產品
來源可存取
來源核驗:
保存在此裝置
已有公開結果SWE-bench VerifiedVerified · 完整Agent榜單 · 500 項工作歷史資料來源資料日來源未公布日期OpenGPT取得時間排名最後變化暫無可比歷史OpenGPT至少每週核查一次此Agent資料來源。
來源結果問題解決率
工作數500 · 經人工核驗的GitHub問題
證據等級存在外部審計提示
開啟來源↗證據說明
這些結果作為歷史證據保留。OpenAI在 2026 年的審計中指出SWE-bench Verified存在設計與資料污染風險。
稽核說明↗1
Claude 4.5 Opus medium (20251101) · live-SWE-agent已列入基準官方榜單 問題解決率79.2%
重複執行證據未公布
來源公布的評測總成本未公布每次成功成本: 未公布
1
Claude 4.5 Opus · Sonar Foundation Agent已列入基準官方榜單 問題解決率79.2%
重複執行證據未公布
來源公布的評測總成本未公布每次成功成本: 未公布
3
Doubao-Seed-Code + Doubao-Seed-1.6 · TRAE已列入基準官方榜單 問題解決率78.8%
重複執行證據未公布
來源公布的評測總成本未公布每次成功成本: 未公布
4
Gemini 3 Pro Preview (2025-11-18) · live-SWE-agent已列入基準官方榜單 問題解決率77.4%
重複執行證據未公布
來源公布的評測總成本未公布每次成功成本: 未公布
5
Claude Sonnet 4 + GPT-5 · Atlassian Rovo Dev · 2025-09-02已列入基準官方榜單 問題解決率76.8%
重複執行證據未公布
來源公布的評測總成本未公布每次成功成本: 未公布
5
Claude 4 Sonnet · EPAM AI/Run Developer Agent · v20250719已列入基準官方榜單 問題解決率76.8%
重複執行證據未公布
來源公布的評測總成本未公布每次成功成本: 未公布
5
Claude 4.5 Opus (high reasoning) · mini-SWE-agent · 2.0.0已列入基準官方榜單 問題解決率76.8%
重複執行證據未公布
來源公布的評測總成本US$376.95每次成功成本: 未公布
8
Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro · ACoder已列入基準官方榜單 問題解決率76.4%
重複執行證據未公布
來源公布的評測總成本未公布每次成功成本: 未公布
9
Gemini 3 Flash (high reasoning) · mini-SWE-agent · 2.0.0已列入基準官方榜單 問題解決率75.8%
重複執行證據未公布
來源公布的評測總成本US$177.98每次成功成本: 未公布
9
MiniMax M2.5 (high reasoning) · mini-SWE-agent · 2.0.0已列入基準官方榜單 問題解決率75.8%
重複執行證據未公布
來源公布的評測總成本US$36.64每次成功成本: 未公布
保存在此裝置
無需API
檢查Agent採用風險
優先項目會調整已發布配置的順序;部署與資料處理答案只顯示風險提示,不會作為篩選條件。
適合從這裡開始的候選
3 個可比較配置
live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2% · 未公布 每次成功成本在此評測配置中的來源結果較高。
Agent詳情 →Sonar Foundation Agent + Claude 4.5 Opus79.2% · 未公布 每次成功成本在此評測配置中的來源結果較高。
Agent詳情 →TRAE + Doubao-Seed-Code78.8% · 未公布 每次成功成本在此評測配置中的來源結果較高。
Agent詳情 → 資料來自公開來源,缺少項目保持未知。
採用前做一次真實驗證
公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。
- 1
選擇 10–20 個代表性工作,並寫清通過條件。
- 2
測試前鎖定Agent、模型、工具、權限與預算。
- 3
重要工作重複執行,記錄成功率、成本、時間與人工接管。
- 4
檢查失敗案例與資料風險後,再決定是否正式採用。