Agent 评测

GAIA Agent 评测

OpenGPT 将15条公开记录保留在下方所示的 GAIA 评测版本与环境内。

任务
165
公开记录
15
来源数据日期
身份核验日期
历史记录

数据范围

HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions. public validation questions. General-assistant questions requiring reasoning, multimodality, browsing, and tools. Source-specific; no normalized step or token limit published.

OpenGPT 如何处理这些数据

OpenGPT 保留发布方的指标、任务范围、环境、版本、配置字段与数据日期,不生成跨评测 Agent 总分。

可比边界

  • 更高结果只适用于所展示的评测版本与条件。
  • Agent 结果反映完整系统,而不是基础模型单独能力。
  • 成本、稳定性、安全性或速度没有公开时保持未报告,不进行推测。
  • HAL reproduced these public-validation rows and publishes scaffold, model, score, cost, run count, and traces. The source has paused adding new models, and it does not publish a normalized tool or step budget.

HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions

展示15条公开记录中的15条;每项结果都保留来源评测与配置。

  1. HAL Generalist Agent · Claude Sonnet 4.5 (September 2025)Holistic Agent Leaderboard · Claude Sonnet 4.5 (September 2025)#1Accuracy: 74.55%HAL Generalist Agent
  2. HAL Generalist Agent · Claude Sonnet 4.5 High (September 2025)Holistic Agent Leaderboard · Claude Sonnet 4.5 High (September 2025)#2Accuracy: 70.91%HAL Generalist Agent
  3. HAL Generalist Agent · Claude Opus 4.1 High (August 2025)Holistic Agent Leaderboard · Claude Opus 4.1 High (August 2025)#3Accuracy: 68.48%HAL Generalist Agent
  4. HAL Generalist Agent · Claude Opus 4 High (May 2025)Holistic Agent Leaderboard · Claude Opus 4 High (May 2025)#4Accuracy: 64.85%HAL Generalist Agent
  5. HAL Generalist Agent · Claude-3.7 Sonnet High (February 2025)Holistic Agent Leaderboard · Claude-3.7 Sonnet High (February 2025)#5Accuracy: 64.24%HAL Generalist Agent
  6. HAL Generalist Agent · Claude Opus 4.1 (August 2025)Holistic Agent Leaderboard · Claude Opus 4.1 (August 2025)#6Accuracy: 64.24%HAL Generalist Agent
  7. HF Open Deep Research · GPT-5 Medium (August 2025)Hugging Face · GPT-5 Medium (August 2025)#7Accuracy: 62.80%HF Open Deep Research
  8. HAL Generalist Agent · GPT-5 Medium (August 2025)Holistic Agent Leaderboard · GPT-5 Medium (August 2025)#8Accuracy: 59.39%HAL Generalist Agent
  9. HAL Generalist Agent · o4-mini Low (April 2025)Holistic Agent Leaderboard · o4-mini Low (April 2025)#9Accuracy: 58.18%HAL Generalist Agent
  10. HF Open Deep Research · Claude Opus 4 (May 2025)Hugging Face · Claude Opus 4 (May 2025)#10Accuracy: 57.58%HF Open Deep Research
  11. HAL Generalist Agent · Claude-3.7 Sonnet (February 2025)Holistic Agent Leaderboard · Claude-3.7 Sonnet (February 2025)#11Accuracy: 56.36%HAL Generalist Agent
  12. HAL Generalist Agent · Claude Haiku 4.5 (October 2025)Holistic Agent Leaderboard · Claude Haiku 4.5 (October 2025)#12Accuracy: 56.36%HAL Generalist Agent
  13. HF Open Deep Research · o4-mini High (April 2025)Hugging Face · o4-mini High (April 2025)#13Accuracy: 55.76%HF Open Deep Research
  14. HAL Generalist Agent · o4-mini High (April 2025)Holistic Agent Leaderboard · o4-mini High (April 2025)#14Accuracy: 54.55%HAL Generalist Agent
  15. HF Open Deep Research · GPT-4.1 (April 2025)Hugging Face · GPT-4.1 (April 2025)#15Accuracy: 50.30%HF Open Deep Research