エージェント構成 · τ³-Banking Knowledge

τ³ Banking AllTools · GPT-5.4 · xhigh

モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。

Pass¹39.43%
成功1件あたり費用未公開
公開された結果範囲未公開

01

構成

エージェントシステムτ³ Banking AllTools · GPT-5.4 · xhigh
基盤モデルGPT-5.4
公開元のモデルIDまたは表記GPT-5.4 · xhigh
スキャフォールドτ³ standard agent
スキャフォールド版v1.0.1
ツールAllTools: BM25, text-embedding-3-large retrieval, and sandboxed shell
環境BM25、埋め込み検索、サンドボックス化コマンド検索を使う標準スキャフォールド
予算各課題4試行 · 1構成あたり388軌跡

02

結果

Pass¹39.43%
部分スコア未公開
成功1件あたり費用未公開
公開された総費用未報告
完了時間の中央値未公開
人の介入未公開

03

運用

反復実行の根拠4回実行
公開された結果範囲未公開
安全上の注意未公開
比較グループtau3-banking-v1-0-1-alltools-gpt-5-2-low-seed-300-4-trials
評価日
データ取得日

04

信頼性

根拠ベンチマーク公開元に掲載
情報源Sierra Research · τ³-Banking
情報源スナップショットv1.0.1 · AllTools · GPT-5.2 lowユーザーシミュレーター · seed 300 · 4試行 · 2026年7月30日
最終確認2026年7月30日
課題数97 銀行知識課題
根拠レベル公開元が管理
根拠の注意

収録行はv1.0.1、銀行知識97課題、AllTools、ユーザーシミュレーター、seed、4試行が一致します。未公開の費用は不明のままです。

監査情報

この結果で分からないこと

結果は表示されたシステムと条件にのみ適用されます。万能な最良エージェント、実運用品質、データ管理、別版での性能を証明しません。

同じ条件で比較

同じベンチマーク版とタスク範囲の構成だけを比較できます。

公開元のデータです。欠損値は不明のまま表示します。

導入前に実務で確認

公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。

  1. 1

    代表的な仕事を10〜20件選び、合格条件を決める。

  2. 2

    Agent、モデル、ツール、権限、予算を固定する。

  3. 3

    重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。

  4. 4

    失敗とデータ取扱いを確認してから導入を決める。

AIエージェントランキング