66 个Agent系统74 条Agent评测配置109 条BFCL工具调用模型结果8 评测范围
收录仅确认公开身份与官方入口,不代表性能排名或推荐;下方榜单只展示同范围的公开评测证据。
Atlassian Rovo DevAtlassian
Agent产品商业产品
来源核验:
Augment AgentAugment Code
Agent产品商业产品
来源可访问
来源核验:
Claude CodeAnthropic
Agent产品商业产品
来源核验:
ClineCline Bot
开源Agent
来源可访问
来源核验:
CodebuffCodebuffAI
开源Agent
来源可访问
来源核验:
Cursor AgentAnysphere
Agent产品商业产品
来源可访问
来源核验:
DevinCognition
Agent产品商业产品
来源可访问
来源核验:
Factory DroidFactory
Agent产品商业产品
来源可访问
来源核验:
保存在此设备
已有公开结果SWE-bench VerifiedVerified · 完整Agent榜单 · 500 个任务历史数据来源数据日来源未公布日期OpenGPT获取时间排名最后变化暂无可比历史OpenGPT至少每周核查一次该Agent数据源。
来源结果问题解决率
任务数500 · 经人工核验的GitHub问题
证据等级存在外部审计提示
打开来源↗证据说明
这些结果作为历史证据保留。OpenAI在 2026 年的审计中指出SWE-bench Verified存在设计和数据污染风险。
审计说明↗1
Claude 4.5 Opus medium (20251101) · live-SWE-agent已列入基准官方榜单 问题解决率79.2%
重复运行证据未公布
来源公布的评测总成本未公布每次成功成本: 未公布
1
Claude 4.5 Opus · Sonar Foundation Agent已列入基准官方榜单 问题解决率79.2%
重复运行证据未公布
来源公布的评测总成本未公布每次成功成本: 未公布
3
Doubao-Seed-Code + Doubao-Seed-1.6 · TRAE已列入基准官方榜单 问题解决率78.8%
重复运行证据未公布
来源公布的评测总成本未公布每次成功成本: 未公布
4
Gemini 3 Pro Preview (2025-11-18) · live-SWE-agent已列入基准官方榜单 问题解决率77.4%
重复运行证据未公布
来源公布的评测总成本未公布每次成功成本: 未公布
5
Claude Sonnet 4 + GPT-5 · Atlassian Rovo Dev · 2025-09-02已列入基准官方榜单 问题解决率76.8%
重复运行证据未公布
来源公布的评测总成本未公布每次成功成本: 未公布
5
Claude 4 Sonnet · EPAM AI/Run Developer Agent · v20250719已列入基准官方榜单 问题解决率76.8%
重复运行证据未公布
来源公布的评测总成本未公布每次成功成本: 未公布
5
Claude 4.5 Opus (high reasoning) · mini-SWE-agent · 2.0.0已列入基准官方榜单 问题解决率76.8%
重复运行证据未公布
来源公布的评测总成本US$376.95每次成功成本: 未公布
8
Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro · ACoder已列入基准官方榜单 问题解决率76.4%
重复运行证据未公布
来源公布的评测总成本未公布每次成功成本: 未公布
9
Gemini 3 Flash (high reasoning) · mini-SWE-agent · 2.0.0已列入基准官方榜单 问题解决率75.8%
重复运行证据未公布
来源公布的评测总成本US$177.98每次成功成本: 未公布
9
MiniMax M2.5 (high reasoning) · mini-SWE-agent · 2.0.0已列入基准官方榜单 问题解决率75.8%
重复运行证据未公布
来源公布的评测总成本US$36.64每次成功成本: 未公布
保存在此设备
无需API
检查Agent采用风险
优先项会调整已发布配置的顺序;部署和数据处理答案只显示风险提示,不会作为筛选条件。
适合从这里开始的候选
3 个可比配置
live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2% · 未公布 每次成功成本在这个评测配置中的来源结果更高。
Agent详情 →Sonar Foundation Agent + Claude 4.5 Opus79.2% · 未公布 每次成功成本在这个评测配置中的来源结果更高。
Agent详情 →TRAE + Doubao-Seed-Code78.8% · 未公布 每次成功成本在这个评测配置中的来源结果更高。
Agent详情 → 数据来自公开来源,缺失项保持未知。
采用前做一次真实验证
公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。
- 1
选择 10–20 个代表性任务,并写清通过条件。
- 2
测试前锁定Agent、模型、工具、权限和预算。
- 3
重要任务重复运行,记录成功率、成本、时间和人工接管。
- 4
检查失败案例和数据风险后,再决定是否正式采用。