Agent 配置 · SWE-bench Verified

ACoder

榜单评估的完整对象,包括模型、框架、工具、权限、预算与运行环境。

系统身份

Agent 系统ACoder
基础模型Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
来源模型 ID 或名称claude-4-sonnet; claude-4.1-opus; gpt-5-0807-global; gemini-2.5-pro-06-17
Agent 框架ACoder
Agent 框架版本未提供
工具未提供
可比组swe-bench-verified-full-500

评测配置

数据快照SWE-bench Verified · Verified · 完整 Agent 榜单 · 500 个任务 · 2026年7月30日
任务数500 经人工核验的 GitHub 问题
运行环境由 SWE-bench 评估的可复现代码仓库环境
预算上限取决于各提交配置
评测日期
数据获取日期
问题解决率76.4%
部分完成分未提供

公开证据

打开来源
证据状态已列入基准官方榜单
数据来源SWE-bench Verified
成本未提供
成本口径来源未提供这个配置的可比成本

来源未提供可比成本,因此不会把它当作低成本候选。

这项结果不能说明什么

结果只适用于这里显示的完整系统和来源条件。它不能证明存在万能 Agent,也不能证明生产可靠性、数据治理或其他评测版本的表现。

全部 AI Agent 榜单