Agent 配置 · OSWorld 2.0
OSWorld Agent · Kimi 2.6 · Enabled · Standard
榜单评估的完整对象,包括模型、框架、工具、权限、预算与运行环境。
完全完成率4.6%
每次成功成本未公布
来源公布的结果范围未公布
01
配置
Agent 系统OSWorld Agent · Kimi 2.6 · Enabled · Standard
基础模型Kimi 2.6
来源模型 ID 或名称Kimi 2.6
Agent 框架OSWorld 2.0 computer-use agent
Agent 框架版本OSWorld 2.0
工具Standard computer-use tool
运行环境可复现虚拟机中的桌面和操作系统任务
预算500 步
02
结果
完全完成率4.6%
部分完成分22.1%
每次成功成本未公布
来源公布的评测总成本US$708
完成时间中位数未公布
人工介入率未公布
03
运行情况
重复运行证据未公布
来源公布的结果范围未公布
安全提示未公布
可比组osworld-2-v2026-06-24-500
评测日期
数据获取日期
04
可信度
证据状态已列入基准官方榜单
数据来源OSWorld 2.0
数据快照任务版本 v2026.06.24 · 500 步上限
来源数据日
OpenGPT 获取时间
排名最后变化暂无可比历史
最近核查
任务数108 长流程电脑操作任务
证据等级发布方维护
证据说明
数据保留了 Agent、模型、工具模式、任务版本、步骤上限和来源指标。
审计说明 ↗这项结果不能说明什么
结果只适用于这里显示的完整系统和来源条件。它不能证明存在万能 Agent,也不能证明生产可靠性、数据治理或其他评测版本的表现。
数据来自公开来源,缺失项保持未知。
采用前做一次真实验证
公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。
- 1
选择 10–20 个代表性任务,并写清通过条件。
- 2
测试前锁定 Agent、模型、工具、权限和预算。
- 3
重要任务重复运行,记录成功率、成本、时间和人工接管。
- 4
检查失败案例和数据风险后,再决定是否正式采用。