准确率2.03%
每次成功成本US$18.9
来源公布的结果范围未公布
01
配置
Agent系统Browser-Use · DeepSeek V3 (March 2025)
基础模型DeepSeek V3 (March 2025)
来源模型ID或名称DeepSeek V3 (March 2025)
Agent框架Browser-Use
Agent框架版本未提供
工具Browser-Use live-web browser automation
运行环境由Holistic Agent Leaderboard复现的实时网页研究与浏览任务
预算取决于来源 · 未公布统一步骤或Token上限
02
结果
准确率2.03%
部分完成分未公布
每次成功成本US$18.9
来源公布的评测总成本US$12.66
完成时间中位数未公布
人工介入率未公布
03
运行情况
重复运行证据1 次运行
来源公布的结果范围未公布
安全提示未公布
可比组hal-assistantbench-public-33-browser-use
评测日期未公布
数据获取日期
04
可信度
证据状态完整公开运行记录
数据来源Holistic Agent Leaderboard · AssistantBench
数据快照HAL核验快照 · 33 个公开任务 · 1 个Agent框架 · 2026年7月30日
最近核查2026年7月30日
任务数33 可自动核验的公开浏览器任务
证据等级存在外部审计提示
证据说明
HAL复现了这些公开数据,并提供运行轨迹、成本和运行次数。由于HAL已暂停加入新模型,且成本未计入缓存收益,应把它视为历史快照。
审计说明 ↗这项结果不能说明什么
结果只适用于这里显示的完整系统和来源条件。它不能证明存在万能Agent,也不能证明生产可靠性、数据治理或其他评测版本的表现。
数据来自公开来源,缺失项保持未知。
采用前做一次真实验证
公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。
- 1
选择 10–20 个代表性任务,并写清通过条件。
- 2
测试前锁定Agent、模型、工具、权限和预算。
- 3
重要任务重复运行,记录成功率、成本、时间和人工接管。
- 4
检查失败案例和数据风险后,再决定是否正式采用。