Agent 配置 · SWE-bench Verified
EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet
榜单评估的完整对象,包括模型、框架、工具、权限、预算与运行环境。
系统身份
Agent 系统EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet
基础模型Claude 4 Sonnet
来源模型 ID 或名称claude-sonnet-4-20250514
Agent 框架EPAM AI/Run Developer Agent
Agent 框架版本v20250719
工具未提供
可比组swe-bench-verified-full-500
评测配置
数据快照SWE-bench Verified · Verified · 完整 Agent 榜单 · 500 个任务 · 2026年7月30日
任务数500 经人工核验的 GitHub 问题
运行环境由 SWE-bench 评估的可复现代码仓库环境
预算上限取决于各提交配置
评测日期
数据获取日期
问题解决率76.8%
部分完成分未提供
公开证据
打开来源证据状态已列入基准官方榜单
数据来源SWE-bench Verified
成本未提供
成本口径来源未提供这个配置的可比成本
来源未提供可比成本,因此不会把它当作低成本候选。
这项结果不能说明什么
结果只适用于这里显示的完整系统和来源条件。它不能证明存在万能 Agent,也不能证明生产可靠性、数据治理或其他评测版本的表现。