共同评测范围 · τ²-bench Core

同评测Agent对比

以下配置来自同一个评测范围,并保留各自的框架、模型版本、日期和来源原始值。

来源值较高只代表这个评测和配置下的结果,不是跨评测总分,也不代表已经适合生产使用。

只比较相同范围

决策概览

只有评测版本和任务范围一致的配置,才能加入同一组对比。

数据来自公开来源,缺失项保持未知。
Zhipu AIτ² standard agent · GLM-5 · thinking
平均Pass¹81.01%每次成功成本未公布来源公布的结果范围未公布
Agent详情
Alibaba Cloudτ² standard agent · Qwen3.5-397B-A17B · thinking
平均Pass¹87.91%每次成功成本未公布来源公布的结果范围未公布
Agent详情
已隐藏18项完全相同或全部未提供的字段
Agent系统τ² standard agent · GLM-5 · thinkingτ² standard agent · Qwen3.5-397B-A17B · thinking
配置
基础模型GLM-5Qwen3.5-397B-A17B
来源模型ID或名称GLM-5 · thinkingQwen3.5-397B-A17B · thinking
结果
平均Pass¹81.01%87.91%
数据来源
打开来源打开来源打开来源

配置

τ² standard agent · GLM-5 · thinking

基础模型
GLM-5
来源模型ID或名称
GLM-5 · thinking

τ² standard agent · Qwen3.5-397B-A17B · thinking

基础模型
Qwen3.5-397B-A17B
来源模型ID或名称
Qwen3.5-397B-A17B · thinking

结果

τ² standard agent · GLM-5 · thinking

平均Pass¹
81.01%

τ² standard agent · Qwen3.5-397B-A17B · thinking

平均Pass¹
87.91%

数据来源

数据来自公开来源,缺失项保持未知。

采用前做一次真实验证

公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。

  1. 1

    选择 10–20 个代表性任务,并写清通过条件。

  2. 2

    测试前锁定Agent、模型、工具、权限和预算。

  3. 3

    重要任务重复运行,记录成功率、成本、时间和人工接管。

  4. 4

    检查失败案例和数据风险后,再决定是否正式采用。

Agent目录与评测