AI Agent目錄與評測

先查找已核驗的Agent產品,再在相同評測範圍內比較公開配置。

評測榜單Top 3SWE-bench Verified · 問題解決率 · 10 個可比較配置
  1. 排名 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. 排名 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. 排名 3TRAE + Doubao-Seed-CodeByteDance78.8%

程式設計

選擇工作類別
資料快照與變化目前還沒有可比較的上期快照。目前來源快照
  1. 排名 1
    基礎模型
    Claude 4.5 Opus medium (20251101)
    Agent框架
    live-SWE-agent
    重複執行證據
    未公布
    來源公布的評測總成本
    未公布
    問題解決率
    79.2%
  2. 排名 1
    基礎模型
    Claude 4.5 Opus
    Agent框架
    Sonar Foundation Agent
    重複執行證據
    未公布
    來源公布的評測總成本
    未公布
    問題解決率
    79.2%
  3. 排名 3
    基礎模型
    Doubao-Seed-Code + Doubao-Seed-1.6
    Agent框架
    TRAE
    重複執行證據
    未公布
    來源公布的評測總成本
    未公布
    問題解決率
    78.8%
  4. 排名 4
    基礎模型
    Gemini 3 Pro Preview (2025-11-18)
    Agent框架
    live-SWE-agent
    重複執行證據
    未公布
    來源公布的評測總成本
    未公布
    問題解決率
    77.4%
  5. 排名 5
    基礎模型
    Claude Sonnet 4 + GPT-5
    Agent框架
    Atlassian Rovo Dev
    Agent框架版本
    2025-09-02
    重複執行證據
    未公布
    來源公布的評測總成本
    未公布
    問題解決率
    76.8%
  6. 排名 5
    基礎模型
    Claude 4 Sonnet
    Agent框架
    EPAM AI/Run Developer Agent
    Agent框架版本
    v20250719
    重複執行證據
    未公布
    來源公布的評測總成本
    未公布
    問題解決率
    76.8%
  7. 排名 5
    基礎模型
    Claude 4.5 Opus (high reasoning)
    Agent框架
    mini-SWE-agent
    Agent框架版本
    2.0.0
    重複執行證據
    未公布
    來源公布的評測總成本
    US$376.95
    問題解決率
    76.8%
  8. 排名 8

    ACoder

    ACoder
    基礎模型
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Agent框架
    ACoder
    重複執行證據
    未公布
    來源公布的評測總成本
    未公布
    問題解決率
    76.4%
  9. 排名 9
    基礎模型
    Gemini 3 Flash (high reasoning)
    Agent框架
    mini-SWE-agent
    Agent框架版本
    2.0.0
    重複執行證據
    未公布
    來源公布的評測總成本
    US$177.98
    問題解決率
    75.8%
  10. 排名 9
    基礎模型
    MiniMax M2.5 (high reasoning)
    Agent框架
    mini-SWE-agent
    Agent框架版本
    2.0.0
    重複執行證據
    未公布
    來源公布的評測總成本
    US$36.64
    問題解決率
    75.8%
結果概覽
結果概覽SWE-bench Verified · 工作成功率
  1. 排名 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. 排名 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. 排名 3TRAE + Doubao-Seed-Code78.8%
  4. 排名 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. 排名 5Atlassian Rovo Dev (2025-09-02)76.8%
已有公開結果SWE-bench VerifiedVerified · 完整Agent榜單 · 500 項工作歷史資料
來源資料日OpenGPT取得時間排名最後變化暫無可比歷史OpenGPT至少每週核查一次此Agent資料來源。
來源結果問題解決率
工作數500 · 經人工核驗的GitHub問題
證據等級存在外部審計提示
開啟來源
證據說明

這些結果作為歷史證據保留。OpenAI在 2026 年的審計中指出SWE-bench Verified存在設計與資料污染風險。

稽核說明
資料來自公開來源,缺少項目保持未知。採用前做一次真實驗證

公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。

  1. 1

    選擇 10–20 個代表性工作,並寫清通過條件。

  2. 2

    測試前鎖定Agent、模型、工具、權限與預算。

  3. 3

    重要工作重複執行,記錄成功率、成本、時間與人工接管。

  4. 4

    檢查失敗案例與資料風險後,再決定是否正式採用。