Agent配置 · τ³-Banking Knowledge
τ³ Banking AllTools · GPT-5.5 · xhigh
榜单评估的完整对象,包括模型、框架、工具、权限、预算与运行环境。
Pass¹46.39%
每次成功成本未公布
来源公布的结果范围未公布
01
配置
Agent系统τ³ Banking AllTools · GPT-5.5 · xhigh
基础模型GPT-5.5
来源模型ID或名称GPT-5.5 · xhigh
Agent框架τ³ standard agent
Agent框架版本v1.0.1
工具AllTools: BM25, text-embedding-3-large retrieval, and sandboxed shell
运行环境使用BM25、向量检索和沙箱命令行搜索的标准Agent框架
预算每项任务 4 次试验 · 每个配置 388 条轨迹
02
结果
Pass¹46.39%
部分完成分未公布
每次成功成本未公布
来源公布的评测总成本未提供
完成时间中位数未公布
人工介入率未公布
03
运行情况
重复运行证据4 次运行
来源公布的结果范围未公布
安全提示未公布
可比组tau3-banking-v1-0-1-alltools-gpt-5-2-low-seed-300-4-trials
评测日期
数据获取日期
04
可信度
证据状态已列入基准官方榜单
数据来源Sierra Research · τ³-Banking
数据快照v1.0.1 · AllTools · GPT-5.2 low用户模拟器 · seed 300 · 4 次试验 · 2026年7月30日
最近核查2026年7月30日
任务数97 银行知识任务
证据等级发布方维护
证据说明
收录数据使用相同的v1.0.1版本、97 个银行知识任务、AllTools配置、用户模拟器、seed和四次试验。未公布的成本保持未知。
审计说明 ↗这项结果不能说明什么
结果只适用于这里显示的完整系统和来源条件。它不能证明存在万能Agent,也不能证明生产可靠性、数据治理或其他评测版本的表现。
数据来自公开来源,缺失项保持未知。
采用前做一次真实验证
公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。
- 1
选择 10–20 个代表性任务,并写清通过条件。
- 2
测试前锁定Agent、模型、工具、权限和预算。
- 3
重要任务重复运行,记录成功率、成本、时间和人工接管。
- 4
检查失败案例和数据风险后,再决定是否正式采用。