Agent 配置 · τ²-bench Core

τ² standard agent · Gemini 3 Flash Preview · high

榜單評估的完整對象,包括模型、框架、工具、權限、預算與執行環境。

平均 Pass¹83.49%
每次成功成本未公布
來源公布的結果範圍未公布

01

配置

Agent 系統τ² standard agent · Gemini 3 Flash Preview · high
基礎模型Gemini 3 Flash Preview
來源模型 ID 或名稱Gemini 3 Flash Preview · high
Agent 框架τ² standard agent
Agent 框架版本v1.0.1
工具Standard retail, airline, and telecom domain tools
執行環境標準 Agent 與領域工具,共用 GPT-5.2 low 推理使用者模擬器
預算每項工作 4 次試驗 · 每個配置 1,112 條軌跡

02

結果

平均 Pass¹83.49%
部分完成分未公布
每次成功成本未公布
來源公布的評測總成本未提供
完成時間中位數未公布
人工介入率未公布

03

執行情況

重複執行證據4 次執行
來源公布的結果範圍未公布
安全提示未公布
可比較組tau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
評測日期
資料取得日期

04

可信度

證據狀態已列入基準官方榜單
資料來源Sierra Research · τ²-bench
資料快照v1.0.1 · 標準 Agent · GPT-5.2 low 使用者模擬器 · 4 次試驗
來源資料日來源未公布日期
OpenGPT 取得時間
排名最後變化暫無可比歷史
最近核查
工作數278 零售、航空與電信基礎工作
證據等級發布方維護
證據說明

只收錄評測 v1.0.1、標準框架與工具、使用者模擬器、基礎工作集與四次試驗條件完全一致的 8 筆發布方資料;其他τ-bench 記錄不在此範圍內。

稽核說明

此結果不能說明什麼

結果只適用於此處顯示的完整系統與來源條件,不能證明萬用 Agent、正式環境可靠性、資料治理或其他版本的表現。

只比較相同範圍

只有評測版本與工作範圍一致的配置,才能加入同一組比較。

資料來自公開來源,缺少項目保持未知。

採用前做一次真實驗證

公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。

  1. 1

    選擇 10–20 個代表性工作,並寫清通過條件。

  2. 2

    測試前鎖定 Agent、模型、工具、權限與預算。

  3. 3

    重要工作重複執行,記錄成功率、成本、時間與人工接管。

  4. 4

    檢查失敗案例與資料風險後,再決定是否正式採用。

全部 AI Agent 榜單