Agent 配置 · SWE-bench Verified
mini-SWE-agent + Claude 4.5 Opus (high reasoning)
榜单评估的完整对象,包括模型、框架、工具、权限、预算与运行环境。
系统身份
Agent 系统mini-SWE-agent + Claude 4.5 Opus (high reasoning)
基础模型Claude 4.5 Opus (high reasoning)
来源模型 ID 或名称claude-4-5-opus
Agent 框架mini-SWE-agent
Agent 框架版本2.0.0
工具Minimal repository shell
可比组swe-bench-verified-full-500
评测配置
数据快照SWE-bench Verified · Verified · 完整 Agent 榜单 · 500 个任务 · 2026年7月30日
任务数500 经人工核验的 GitHub 问题
运行环境由 SWE-bench 评估的可复现代码仓库环境
预算上限取决于各提交配置
评测日期
数据获取日期
问题解决率76.8%
部分完成分未提供
公开证据
打开来源证据状态已列入基准官方榜单
数据来源SWE-bench Verified
成本US$376.95
成本口径来源提供的整套评测成本
这项结果不能说明什么
结果只适用于这里显示的完整系统和来源条件。它不能证明存在万能 Agent,也不能证明生产可靠性、数据治理或其他评测版本的表现。