公开 Agent 评测

AI Agent 榜单

在同一公开评测范围内比较已发布的 Agent 配置。每项结果都保留原始量尺和来源公开的配置信息。

不跨评测合成总分。OpenGPT 整理上游公开结果,没有重新运行这些评测。

Agent 系统

榜单评估的完整对象,包括模型、框架、工具、权限、预算与运行环境。

基础模型

系统中的一个组成部分,Agent 的结果不能归因于模型本身。

无需 API

找到值得进一步了解的 Agent 配置

任务和优先项决定候选顺序;部署与数据边界用于提示需要核查的风险。只使用已发布快照中的配置。

选择任务类别

编程 Agent

SWE-bench Verified

Verified · 完整 Agent 榜单 · 500 个任务 · 数据获取日期 2026年7月30日

打开来源
来源结果问题解决率
任务数500 经人工核验的 GitHub 问题
运行环境由 SWE-bench 评估的可复现代码仓库环境
预算上限取决于各提交配置
1
live-SWE-agent + Claude 4.5 Opus medium (20251101)基础模型: Claude 4.5 Opus medium (20251101)来源模型 ID 或名称: claude-opus-4-5-20251101已列入基准官方榜单
Agent 框架: live-SWE-agentAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜单 · 500 个任务
问题解决率79.2%
成本未提供2025年12月15日
1
Sonar Foundation Agent + Claude 4.5 Opus基础模型: Claude 4.5 Opus来源模型 ID 或名称: claude-opus-4-5已列入基准官方榜单
Agent 框架: Sonar Foundation AgentAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜单 · 500 个任务
问题解决率79.2%
成本未提供2025年12月5日
3
TRAE + Doubao-Seed-Code基础模型: Doubao-Seed-Code + Doubao-Seed-1.6来源模型 ID 或名称: Doubao-Seed-Code; Doubao-Seed-1.6已列入基准官方榜单
Agent 框架: TRAEAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜单 · 500 个任务
问题解决率78.8%
成本未提供2025年9月28日
4
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)基础模型: Gemini 3 Pro Preview (2025-11-18)来源模型 ID 或名称: gemini-3-pro-preview已列入基准官方榜单
Agent 框架: live-SWE-agentAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜单 · 500 个任务
问题解决率77.4%
成本未提供2025年11月20日
5
Atlassian Rovo Dev (2025-09-02)基础模型: Claude Sonnet 4 + GPT-5来源模型 ID 或名称: claude-sonnet-4-20250514; gpt-5已列入基准官方榜单
Agent 框架: Atlassian Rovo DevAgent 框架版本: 2025-09-02工具: 未提供Verified · 完整 Agent 榜单 · 500 个任务
问题解决率76.8%
成本未提供2025年9月2日
5
EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet基础模型: Claude 4 Sonnet来源模型 ID 或名称: claude-sonnet-4-20250514已列入基准官方榜单
Agent 框架: EPAM AI/Run Developer AgentAgent 框架版本: v20250719工具: 未提供Verified · 完整 Agent 榜单 · 500 个任务
问题解决率76.8%
成本未提供2025年8月4日
5
mini-SWE-agent + Claude 4.5 Opus (high reasoning)基础模型: Claude 4.5 Opus (high reasoning)来源模型 ID 或名称: claude-4-5-opus已列入基准官方榜单
Agent 框架: mini-SWE-agentAgent 框架版本: 2.0.0工具: Minimal repository shellVerified · 完整 Agent 榜单 · 500 个任务
问题解决率76.8%
成本US$376.952026年2月17日
8
ACoder基础模型: Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro来源模型 ID 或名称: claude-4-sonnet; claude-4.1-opus; gpt-5-0807-global; gemini-2.5-pro-06-17已列入基准官方榜单
Agent 框架: ACoderAgent 框架版本: 未提供工具: 未提供Verified · 完整 Agent 榜单 · 500 个任务
问题解决率76.4%
成本未提供2025年8月19日
9
mini-SWE-agent + Gemini 3 Flash (high reasoning)基础模型: Gemini 3 Flash (high reasoning)来源模型 ID 或名称: gemini-3-flash-preview已列入基准官方榜单
Agent 框架: mini-SWE-agentAgent 框架版本: 2.0.0工具: Minimal repository shellVerified · 完整 Agent 榜单 · 500 个任务
问题解决率75.8%
成本US$177.982026年2月17日
9
mini-SWE-agent + MiniMax M2.5 (high reasoning)基础模型: MiniMax M2.5 (high reasoning)来源模型 ID 或名称: minimax-m2.5已列入基准官方榜单
Agent 框架: mini-SWE-agentAgent 框架版本: 2.0.0工具: Minimal repository shellVerified · 完整 Agent 榜单 · 500 个任务
问题解决率75.8%
成本US$36.642026年2月17日