エージェント構成 · GAIA
HAL Generalist Agent · Claude Opus 4.1 High (August 2025)
モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。
正解率68.48%
成功1件あたり費用$4.98
公開された結果範囲未公開
01
構成
エージェントシステムHAL Generalist Agent · Claude Opus 4.1 High (August 2025)
基盤モデルClaude Opus 4.1 High (August 2025)
公開元のモデルIDまたは表記Claude Opus 4.1 High (August 2025)
スキャフォールドHAL Generalist Agent
スキャフォールド版未報告
ツール未報告
環境推論、マルチモーダル、ブラウザ、ツールを必要とする汎用アシスタント課題
予算公開元ごとに異なる · 共通のステップ・トークン上限は未公開
02
結果
正解率68.48%
部分スコア未公開
成功1件あたり費用$4.98
公開された総費用$562.24
完了時間の中央値未公開
人の介入未公開
03
運用
反復実行の根拠1回実行
公開された結果範囲未公開
安全上の注意未公開
比較グループhal-gaia-public-validation-165
評価日未公開
データ取得日
04
信頼性
根拠完全な公開実行記録
情報源Holistic Agent Leaderboard · GAIA
情報源スナップショットHAL検証済みスナップショット · 公開検証セット · 165問 · 2026年7月30日
最終確認2026年7月30日
課題数165 公開検証問題
根拠レベル外部の注意情報あり
根拠の注意
HALが公開検証行を再現し、スキャフォールド、モデル、得点、費用、実行回数、軌跡を公開しています。共通のツール・ステップ上限は未公開で、過去のスナップショットです。
監査情報 ↗この結果で分からないこと
結果は表示されたシステムと条件にのみ適用されます。万能な最良エージェント、実運用品質、データ管理、別版での性能を証明しません。
公開元のデータです。欠損値は不明のまま表示します。
導入前に実務で確認
公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。
- 1
代表的な仕事を10〜20件選び、合格条件を決める。
- 2
Agent、モデル、ツール、権限、予算を固定する。
- 3
重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。
- 4
失敗とデータ取扱いを確認してから導入を決める。