共同评测范围 · SWE-bench Verified

同评测Agent对比

以下配置来自同一个评测范围,并保留各自的框架、模型版本、日期和来源原始值。

来源值较高只代表这个评测和配置下的结果,不是跨评测总分,也不代表已经适合生产使用。

只比较相同范围

决策概览

只有评测版本和任务范围一致的配置,才能加入同一组对比。

数据来自公开来源,缺失项保持未知。
UIUClive-SWE-agent + Claude 4.5 Opus medium (20251101)
问题解决率79.2%每次成功成本未公布来源公布的结果范围未公布
Agent详情
UIUClive-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
问题解决率77.4%每次成功成本未公布来源公布的结果范围未公布
Agent详情
已隐藏17项完全相同或全部未提供的字段
Agent系统live-SWE-agent + Claude 4.5 Opus medium (20251101)live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
配置
基础模型Claude 4.5 Opus medium (20251101)Gemini 3 Pro Preview (2025-11-18)
来源模型ID或名称claude-opus-4-5-20251101gemini-3-pro-preview
结果
问题解决率79.2%77.4%
可信度
评测日期2025年12月15日2025年11月20日
数据来源
打开来源打开来源打开来源

配置

live-SWE-agent + Claude 4.5 Opus medium (20251101)

基础模型
Claude 4.5 Opus medium (20251101)
来源模型ID或名称
claude-opus-4-5-20251101

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

基础模型
Gemini 3 Pro Preview (2025-11-18)
来源模型ID或名称
gemini-3-pro-preview

结果

live-SWE-agent + Claude 4.5 Opus medium (20251101)

问题解决率
79.2%

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

问题解决率
77.4%

可信度

live-SWE-agent + Claude 4.5 Opus medium (20251101)

评测日期
2025年12月15日

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

评测日期
2025年11月20日

数据来源

数据来自公开来源,缺失项保持未知。

采用前做一次真实验证

公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。

  1. 1

    选择 10–20 个代表性任务,并写清通过条件。

  2. 2

    测试前锁定Agent、模型、工具、权限和预算。

  3. 3

    重要任务重复运行,记录成功率、成本、时间和人工接管。

  4. 4

    检查失败案例和数据风险后,再决定是否正式采用。

Agent目录与评测