エージェント構成 · τ²-bench Core
τ² standard agent · Claude Opus 4.5 · high
モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。
平均Pass¹85.31%
成功1件あたり費用未公開
公開された結果範囲未公開
01
構成
エージェントシステムτ² standard agent · Claude Opus 4.5 · high
基盤モデルClaude Opus 4.5
公開元のモデルIDまたは表記Claude Opus 4.5 · high
スキャフォールドτ² standard agent
スキャフォールド版v1.0.1
ツールStandard retail, airline, and telecom domain tools
環境標準Agentと業務ツール、共通のGPT-5.2 low推論ユーザーシミュレーター
予算各課題4試行 · 1構成あたり1,112軌跡
02
結果
平均Pass¹85.31%
部分スコア未公開
成功1件あたり費用未公開
公開された総費用未報告
完了時間の中央値未公開
人の介入未公開
03
運用
反復実行の根拠4回実行
公開された結果範囲未公開
安全上の注意未公開
比較グループtau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
評価日
データ取得日
04
信頼性
根拠ベンチマーク公開元に掲載
情報源Sierra Research · τ²-bench
情報源スナップショットv1.0.1 · 標準Agent · GPT-5.2 lowユーザーシミュレーター · 4試行 · 2026年7月30日
最終確認2026年7月30日
課題数278 小売・航空・通信の基本課題
根拠レベル公開元が管理
根拠の注意
v1.0.1、標準スキャフォールドとツール、共通ユーザーシミュレーター、基本課題分割、4試行が一致する公開元提出8行だけを収録しています。その他のτ-bench行はこの範囲外です。
監査情報 ↗この結果で分からないこと
結果は表示されたシステムと条件にのみ適用されます。万能な最良エージェント、実運用品質、データ管理、別版での性能を証明しません。
公開元のデータです。欠損値は不明のまま表示します。
導入前に実務で確認
公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。
- 1
代表的な仕事を10〜20件選び、合格条件を決める。
- 2
Agent、モデル、ツール、権限、予算を固定する。
- 3
重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。
- 4
失敗とデータ取扱いを確認してから導入を決める。