エージェント評価

τ²-bench Coreエージェント評価

τ²-bench Coreの表示版と環境に結び付いた公開行8件を保持します。

課題
278
公開行
8
情報源データ日
ID確認日
現在

根拠の範囲

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials. base tasks across retail, airline, and telecom. Standard agent, standard domain tools, and a shared GPT-5.2 low-reasoning user simulator. 4 trials per task · 1,112 trajectories per configuration.

OpenGPTでの根拠の扱い

公開元の指標、課題範囲、環境、版、構成、日付を保持し、評価を横断した総合点は作りません。

比較できる範囲

  • 高い値は表示された評価版と条件にだけ適用されます。
  • 結果は基盤モデル単体ではなくエージェント全体を反映します。
  • 費用、信頼性、安全性、速度の欠損値は推測しません。
  • OpenGPTに含まれるのは、ベンチマークv1.0.1、標準スキャフォールドとツール、同じユーザーシミュレーター、同じ基本タスク分割、4回の試行が共通する、公開元提出の8行だけです。その他のτ-bench行は対象外です。

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials

公開8件のうち8件を表示します。結果は元の評価と構成に結び付いています。

  1. τ² standard agent · Qwen3.5-397B-A17B · thinkingAlibaba Cloud · Qwen3.5-397B-A17B#1Average Pass¹: 87.91%τ² standard agent
  2. τ² standard agent · Claude Opus 4.5 · 高Anthropic · Claude Opus 4.5#2Average Pass¹: 85.31%τ² standard agent
  3. τ² standard agent · GPT-5.2 · 高OpenAI · GPT-5.2#3Average Pass¹: 84.76%τ² standard agent
  4. τ² standard agent · Gemini 3 Flash Preview · 高Google · Gemini 3 Flash Preview#4Average Pass¹: 83.49%τ² standard agent
  5. τ² standard agent · Gemini 3 Pro Preview · 高Google · Gemini 3 Pro Preview#5Average Pass¹: 82.46%τ² standard agent
  6. τ² standard agent · GLM-5 · thinkingZhipu AI · GLM-5#6Average Pass¹: 81.01%τ² standard agent
  7. τ² standard agent · Claude Sonnet 4.5 · 拡張思考Anthropic · Claude Sonnet 4.5#7Average Pass¹: 76.41%τ² standard agent
  8. τ² standard agent · GPT-5.2 · 推論なしOpenAI · GPT-5.2#8Average Pass¹: 61.58%τ² standard agent