平均Pass¹81.01%每次成功成本未公布来源公布的结果范围未公布
Agent详情 →共同评测范围 · τ²-bench Core
同评测Agent对比
以下配置来自同一个评测范围,并保留各自的框架、模型版本、日期和来源原始值。
来源值较高只代表这个评测和配置下的结果,不是跨评测总分,也不代表已经适合生产使用。
只比较相同范围
决策概览
只有评测版本和任务范围一致的配置,才能加入同一组对比。
平均Pass¹87.91%每次成功成本未公布来源公布的结果范围未公布
Agent详情 →已隐藏18项完全相同或全部未提供的字段
| Agent系统 | τ² standard agent · GLM-5 · thinking | τ² standard agent · Qwen3.5-397B-A17B · thinking |
|---|---|---|
| 配置 | ||
| 基础模型 | GLM-5 | Qwen3.5-397B-A17B |
| 来源模型ID或名称 | GLM-5 · thinking | Qwen3.5-397B-A17B · thinking |
| 结果 | ||
| 平均Pass¹ | 81.01% | 87.91% |
| 数据来源 | ||
| 打开来源 | 打开来源 ↗ | 打开来源 ↗ |
配置
τ² standard agent · GLM-5 · thinking
- 基础模型
- GLM-5
- 来源模型ID或名称
- GLM-5 · thinking
τ² standard agent · Qwen3.5-397B-A17B · thinking
- 基础模型
- Qwen3.5-397B-A17B
- 来源模型ID或名称
- Qwen3.5-397B-A17B · thinking
结果
τ² standard agent · GLM-5 · thinking
- 平均Pass¹
- 81.01%
τ² standard agent · Qwen3.5-397B-A17B · thinking
- 平均Pass¹
- 87.91%
数据来源
数据来自公开来源,缺失项保持未知。
采用前做一次真实验证
公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。
- 1
选择 10–20 个代表性任务,并写清通过条件。
- 2
测试前锁定Agent、模型、工具、权限和预算。
- 3
重要任务重复运行,记录成功率、成本、时间和人工接管。
- 4
检查失败案例和数据风险后,再决定是否正式采用。