AI Agent目录与评测

先查找已核验的Agent产品,再在同一评测范围内比较公开配置。

评测榜单Top 3SWE-bench Verified · 问题解决率 · 10 个可比配置
  1. 排名 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. 排名 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. 排名 3TRAE + Doubao-Seed-CodeByteDance78.8%

编程

选择任务类别
数据快照与变化目前还没有可比的上期快照。当前来源快照
  1. 排名 1
    基础模型
    Claude 4.5 Opus medium (20251101)
    Agent框架
    live-SWE-agent
    重复运行证据
    未公布
    来源公布的评测总成本
    未公布
    问题解决率
    79.2%
  2. 排名 1
    基础模型
    Claude 4.5 Opus
    Agent框架
    Sonar Foundation Agent
    重复运行证据
    未公布
    来源公布的评测总成本
    未公布
    问题解决率
    79.2%
  3. 排名 3
    基础模型
    Doubao-Seed-Code + Doubao-Seed-1.6
    Agent框架
    TRAE
    重复运行证据
    未公布
    来源公布的评测总成本
    未公布
    问题解决率
    78.8%
  4. 排名 4
    基础模型
    Gemini 3 Pro Preview (2025-11-18)
    Agent框架
    live-SWE-agent
    重复运行证据
    未公布
    来源公布的评测总成本
    未公布
    问题解决率
    77.4%
  5. 排名 5
    基础模型
    Claude Sonnet 4 + GPT-5
    Agent框架
    Atlassian Rovo Dev
    Agent框架版本
    2025-09-02
    重复运行证据
    未公布
    来源公布的评测总成本
    未公布
    问题解决率
    76.8%
  6. 排名 5
    基础模型
    Claude 4 Sonnet
    Agent框架
    EPAM AI/Run Developer Agent
    Agent框架版本
    v20250719
    重复运行证据
    未公布
    来源公布的评测总成本
    未公布
    问题解决率
    76.8%
  7. 排名 5
    基础模型
    Claude 4.5 Opus (high reasoning)
    Agent框架
    mini-SWE-agent
    Agent框架版本
    2.0.0
    重复运行证据
    未公布
    来源公布的评测总成本
    US$376.95
    问题解决率
    76.8%
  8. 排名 8

    ACoder

    ACoder
    基础模型
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Agent框架
    ACoder
    重复运行证据
    未公布
    来源公布的评测总成本
    未公布
    问题解决率
    76.4%
  9. 排名 9
    基础模型
    Gemini 3 Flash (high reasoning)
    Agent框架
    mini-SWE-agent
    Agent框架版本
    2.0.0
    重复运行证据
    未公布
    来源公布的评测总成本
    US$177.98
    问题解决率
    75.8%
  10. 排名 9
    基础模型
    MiniMax M2.5 (high reasoning)
    Agent框架
    mini-SWE-agent
    Agent框架版本
    2.0.0
    重复运行证据
    未公布
    来源公布的评测总成本
    US$36.64
    问题解决率
    75.8%
结果概览
结果概览SWE-bench Verified · 任务成功率
  1. 排名 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. 排名 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. 排名 3TRAE + Doubao-Seed-Code78.8%
  4. 排名 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. 排名 5Atlassian Rovo Dev (2025-09-02)76.8%
已有公开结果SWE-bench VerifiedVerified · 完整Agent榜单 · 500 个任务历史数据
来源数据日OpenGPT获取时间排名最后变化暂无可比历史OpenGPT至少每周核查一次该Agent数据源。
来源结果问题解决率
任务数500 · 经人工核验的GitHub问题
证据等级存在外部审计提示
打开来源
证据说明

这些结果作为历史证据保留。OpenAI在 2026 年的审计中指出SWE-bench Verified存在设计和数据污染风险。

审计说明
数据来自公开来源,缺失项保持未知。采用前做一次真实验证

公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。

  1. 1

    选择 10–20 个代表性任务,并写清通过条件。

  2. 2

    测试前锁定Agent、模型、工具、权限和预算。

  3. 3

    重要任务重复运行,记录成功率、成本、时间和人工接管。

  4. 4

    检查失败案例和数据风险后,再决定是否正式采用。