Agent 配置 · τ²-bench Core

τ² standard agent · Qwen3.5-397B-A17B · thinking

榜单评估的完整对象,包括模型、框架、工具、权限、预算与运行环境。

平均 Pass¹87.91%
每次成功成本未公布
来源公布的结果范围未公布

01

配置

Agent 系统τ² standard agent · Qwen3.5-397B-A17B · thinking
基础模型Qwen3.5-397B-A17B
来源模型 ID 或名称Qwen3.5-397B-A17B · thinking
Agent 框架τ² standard agent
Agent 框架版本v1.0.1
工具Standard retail, airline, and telecom domain tools
运行环境标准 Agent 与领域工具,共用 GPT-5.2 low 推理用户模拟器
预算每项任务 4 次试验 · 每个配置 1,112 条轨迹

02

结果

平均 Pass¹87.91%
部分完成分未公布
每次成功成本未公布
来源公布的评测总成本未提供
完成时间中位数未公布
人工介入率未公布

03

运行情况

重复运行证据4 次运行
来源公布的结果范围未公布
安全提示未公布
可比组tau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
评测日期
数据获取日期

04

可信度

证据状态已列入基准官方榜单
数据来源Sierra Research · τ²-bench
数据快照v1.0.1 · 标准 Agent · GPT-5.2 low 用户模拟器 · 4 次试验
来源数据日来源未公布日期
OpenGPT 获取时间
排名最后变化暂无可比历史
最近核查
任务数278 零售、航空和电信基础任务
证据等级发布方维护
证据说明

只收录评测 v1.0.1、标准框架与工具、用户模拟器、基础任务集和四次试验条件完全一致的 8 条发布方数据;其他τ-bench 记录不在这个范围内。

审计说明

这项结果不能说明什么

结果只适用于这里显示的完整系统和来源条件。它不能证明存在万能 Agent,也不能证明生产可靠性、数据治理或其他评测版本的表现。

只比较相同范围

只有评测版本和任务范围一致的配置,才能加入同一组对比。

数据来自公开来源,缺失项保持未知。

采用前做一次真实验证

公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。

  1. 1

    选择 10–20 个代表性任务,并写清通过条件。

  2. 2

    测试前锁定 Agent、模型、工具、权限和预算。

  3. 3

    重要任务重复运行,记录成功率、成本、时间和人工接管。

  4. 4

    检查失败案例和数据风险后,再决定是否正式采用。

全部 AI Agent 榜单