榜單評估的完整對象,包括模型、框架、工具、權限、預算與執行環境。
公開 Agent 評測
AI Agent 榜單
在同一公開評測範圍內比較已發布的 Agent 配置。每項結果都保留原始量尺和來源公開的配置資訊。
不跨評測合成總分。OpenGPT 整理上游公開結果,沒有重新執行這些評測。
系統中的一個組成部分,Agent 結果不能歸因於模型本身。
無需 API
找到值得進一步了解的 Agent 配置
工作與優先項目決定候選順序;部署與資料邊界用於提示需核查的風險。只使用已發布快照中的配置。
選擇工作類別
程式 Agent
SWE-bench Verified
Verified · 完整 Agent 榜單 · 500 項工作 · 資料取得日期 2026年7月30日
來源結果問題解決率
工作數500 經人工核驗的 GitHub 問題
執行環境由 SWE-bench 評估的可重現程式碼倉庫環境
預算上限取決於各提交配置
1
live-SWE-agent + Claude 4.5 Opus medium (20251101)基礎模型: Claude 4.5 Opus medium (20251101)來源模型 ID 或名稱: claude-opus-4-5-20251101已列入基準官方榜單
Agent 框架: live-SWE-agentAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜單 · 500 項工作
問題解決率79.2%
成本未提供2025年12月15日
1
Sonar Foundation Agent + Claude 4.5 Opus基礎模型: Claude 4.5 Opus來源模型 ID 或名稱: claude-opus-4-5已列入基準官方榜單
Agent 框架: Sonar Foundation AgentAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜單 · 500 項工作
問題解決率79.2%
成本未提供2025年12月5日
3
TRAE + Doubao-Seed-Code基礎模型: Doubao-Seed-Code + Doubao-Seed-1.6來源模型 ID 或名稱: Doubao-Seed-Code; Doubao-Seed-1.6已列入基準官方榜單
Agent 框架: TRAEAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜單 · 500 項工作
問題解決率78.8%
成本未提供2025年9月28日
4
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)基礎模型: Gemini 3 Pro Preview (2025-11-18)來源模型 ID 或名稱: gemini-3-pro-preview已列入基準官方榜單
Agent 框架: live-SWE-agentAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜單 · 500 項工作
問題解決率77.4%
成本未提供2025年11月20日
5
Atlassian Rovo Dev (2025-09-02)基礎模型: Claude Sonnet 4 + GPT-5來源模型 ID 或名稱: claude-sonnet-4-20250514; gpt-5已列入基準官方榜單
Agent 框架: Atlassian Rovo DevAgent 框架版本: 2025-09-02工具: 未提供Verified · 完整 Agent 榜單 · 500 項工作
問題解決率76.8%
成本未提供2025年9月2日
5
EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet基礎模型: Claude 4 Sonnet來源模型 ID 或名稱: claude-sonnet-4-20250514已列入基準官方榜單
Agent 框架: EPAM AI/Run Developer AgentAgent 框架版本: v20250719工具: 未提供Verified · 完整 Agent 榜單 · 500 項工作
問題解決率76.8%
成本未提供2025年8月4日
5
mini-SWE-agent + Claude 4.5 Opus (high reasoning)基礎模型: Claude 4.5 Opus (high reasoning)來源模型 ID 或名稱: claude-4-5-opus已列入基準官方榜單
Agent 框架: mini-SWE-agentAgent 框架版本: 2.0.0工具: Minimal repository shellVerified · 完整 Agent 榜單 · 500 項工作
問題解決率76.8%
成本US$376.952026年2月17日
8
ACoder基礎模型: Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro來源模型 ID 或名稱: claude-4-sonnet; claude-4.1-opus; gpt-5-0807-global; gemini-2.5-pro-06-17已列入基準官方榜單
Agent 框架: ACoderAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜單 · 500 項工作
問題解決率76.4%
成本未提供2025年8月19日
9
mini-SWE-agent + Gemini 3 Flash (high reasoning)基礎模型: Gemini 3 Flash (high reasoning)來源模型 ID 或名稱: gemini-3-flash-preview已列入基準官方榜單
Agent 框架: mini-SWE-agentAgent 框架版本: 2.0.0工具: Minimal repository shellVerified · 完整 Agent 榜單 · 500 項工作
問題解決率75.8%
成本US$177.982026年2月17日
9
mini-SWE-agent + MiniMax M2.5 (high reasoning)基礎模型: MiniMax M2.5 (high reasoning)來源模型 ID 或名稱: minimax-m2.5已列入基準官方榜單
Agent 框架: mini-SWE-agentAgent 框架版本: 2.0.0工具: Minimal repository shellVerified · 完整 Agent 榜單 · 500 項工作
問題解決率75.8%
成本US$36.642026年2月17日