エージェント評価
GAIAエージェント評価
GAIAの表示版と環境に結び付いた公開行15件を保持します。
- 課題
- 165
- 公開行
- 15
- 情報源データ日
- ID確認日
- 履歴
根拠の範囲
HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions. public validation questions. General-assistant questions requiring reasoning, multimodality, browsing, and tools. Source-specific; no normalized step or token limit published.
OpenGPTでの根拠の扱い
公開元の指標、課題範囲、環境、版、構成、日付を保持し、評価を横断した総合点は作りません。
比較できる範囲
- 高い値は表示された評価版と条件にだけ適用されます。
- 結果は基盤モデル単体ではなくエージェント全体を反映します。
- 費用、信頼性、安全性、速度の欠損値は推測しません。
- HAL reproduced these public-validation rows and publishes scaffold, model, score, cost, run count, and traces. The source has paused adding new models, and it does not publish a normalized tool or step budget.
HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
公開15件のうち15件を表示します。結果は元の評価と構成に結び付いています。
- HAL Generalist Agent · Claude Sonnet 4.5 (September 2025)Holistic Agent Leaderboard · Claude Sonnet 4.5 (September 2025)#1Accuracy: 74.55%HAL Generalist Agent
- HAL Generalist Agent · Claude Sonnet 4.5 High (September 2025)Holistic Agent Leaderboard · Claude Sonnet 4.5 High (September 2025)#2Accuracy: 70.91%HAL Generalist Agent
- HAL Generalist Agent · Claude Opus 4.1 High (August 2025)Holistic Agent Leaderboard · Claude Opus 4.1 High (August 2025)#3Accuracy: 68.48%HAL Generalist Agent
- HAL Generalist Agent · Claude Opus 4 High (May 2025)Holistic Agent Leaderboard · Claude Opus 4 High (May 2025)#4Accuracy: 64.85%HAL Generalist Agent
- HAL Generalist Agent · Claude-3.7 Sonnet High (February 2025)Holistic Agent Leaderboard · Claude-3.7 Sonnet High (February 2025)#5Accuracy: 64.24%HAL Generalist Agent
- HAL Generalist Agent · Claude Opus 4.1 (August 2025)Holistic Agent Leaderboard · Claude Opus 4.1 (August 2025)#6Accuracy: 64.24%HAL Generalist Agent
- HF Open Deep Research · GPT-5 Medium (August 2025)Hugging Face · GPT-5 Medium (August 2025)#7Accuracy: 62.80%HF Open Deep Research
- HAL Generalist Agent · GPT-5 Medium (August 2025)Holistic Agent Leaderboard · GPT-5 Medium (August 2025)#8Accuracy: 59.39%HAL Generalist Agent
- HAL Generalist Agent · o4-mini Low (April 2025)Holistic Agent Leaderboard · o4-mini Low (April 2025)#9Accuracy: 58.18%HAL Generalist Agent
- HF Open Deep Research · Claude Opus 4 (May 2025)Hugging Face · Claude Opus 4 (May 2025)#10Accuracy: 57.58%HF Open Deep Research
- HAL Generalist Agent · Claude-3.7 Sonnet (February 2025)Holistic Agent Leaderboard · Claude-3.7 Sonnet (February 2025)#11Accuracy: 56.36%HAL Generalist Agent
- HAL Generalist Agent · Claude Haiku 4.5 (October 2025)Holistic Agent Leaderboard · Claude Haiku 4.5 (October 2025)#12Accuracy: 56.36%HAL Generalist Agent
- HF Open Deep Research · o4-mini High (April 2025)Hugging Face · o4-mini High (April 2025)#13Accuracy: 55.76%HF Open Deep Research
- HAL Generalist Agent · o4-mini High (April 2025)Holistic Agent Leaderboard · o4-mini High (April 2025)#14Accuracy: 54.55%HAL Generalist Agent
- HF Open Deep Research · GPT-4.1 (April 2025)Hugging Face · GPT-4.1 (April 2025)#15Accuracy: 50.30%HF Open Deep Research