共同評測範圍 · SWE-bench Verified

同評測Agent比較

以下配置來自同一個評測範圍,並保留各自的框架、模型版本、日期與來源原始值。

來源值較高只代表此評測與配置下的結果,不是跨評測總分,也不代表已適合正式使用。

只比較相同範圍

決策概覽

只有評測版本與工作範圍一致的配置,才能加入同一組比較。

資料來自公開來源,缺少項目保持未知。
UIUClive-SWE-agent + Claude 4.5 Opus medium (20251101)
問題解決率79.2%每次成功成本未公布來源公布的結果範圍未公布
Agent詳情
UIUClive-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
問題解決率77.4%每次成功成本未公布來源公布的結果範圍未公布
Agent詳情
已隱藏17項完全相同或全部未提供的欄位
Agent系統live-SWE-agent + Claude 4.5 Opus medium (20251101)live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
配置
基礎模型Claude 4.5 Opus medium (20251101)Gemini 3 Pro Preview (2025-11-18)
來源模型ID或名稱claude-opus-4-5-20251101gemini-3-pro-preview
結果
問題解決率79.2%77.4%
可信度
評測日期2025年12月15日2025年11月20日
資料來源
開啟來源開啟來源開啟來源

配置

live-SWE-agent + Claude 4.5 Opus medium (20251101)

基礎模型
Claude 4.5 Opus medium (20251101)
來源模型ID或名稱
claude-opus-4-5-20251101

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

基礎模型
Gemini 3 Pro Preview (2025-11-18)
來源模型ID或名稱
gemini-3-pro-preview

結果

live-SWE-agent + Claude 4.5 Opus medium (20251101)

問題解決率
79.2%

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

問題解決率
77.4%

可信度

live-SWE-agent + Claude 4.5 Opus medium (20251101)

評測日期
2025年12月15日

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

評測日期
2025年11月20日

資料來源

資料來自公開來源,缺少項目保持未知。

採用前做一次真實驗證

公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。

  1. 1

    選擇 10–20 個代表性工作,並寫清通過條件。

  2. 2

    測試前鎖定Agent、模型、工具、權限與預算。

  3. 3

    重要工作重複執行,記錄成功率、成本、時間與人工接管。

  4. 4

    檢查失敗案例與資料風險後,再決定是否正式採用。

Agent目錄與評測