Benchmark degli Agent

Benchmark degli agenti di GAIA

OpenGPT mantiene 15 righe pubblicate associate alla versione esatta del benchmark GAIA e all’ambiente mostrato sotto.

Attività
165
Righe pubblicate
15
Data dei dati della fonte
Identità esaminata
Storico

Ambito delle evidenze

HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions. public validation questions. General-assistant questions requiring reasoning, multimodality, browsing, and tools. Source-specific; no normalized step or token limit published.

How OpenGPT handles this evidence

OpenGPT conserva la metrica, l’ambito delle attività, l’ambiente, la versione, i campi della configurazione e la data della fonte indicati dal publisher. Non crea un punteggio complessivo degli Agent tra benchmark diversi.

Limiti del confronto

  • Un risultato più elevato si applica solo alla versione del benchmark e alle condizioni visualizzate.
  • I risultati degli Agent riflettono il sistema completo, non soltanto il modello di base.
  • I dati mancanti su costi, affidabilità, sicurezza o latenza restano non indicati anziché essere dedotti.
  • HAL ha riprodotto queste righe di convalida pubblica e pubblica scaffold, modello, punteggio, costo, conteggio delle esecuzioni e tracce. La fonte ha sospeso l’aggiunta di nuovi modelli e non pubblica un budget normalizzato di strumenti o passaggi.

HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions

Visualizzate 15 di 15 righe pubblicate. Ogni risultato rimane associato al benchmark e alla configurazione della fonte.

  1. HAL Generalist Agent · Claude Sonnet 4.5 (September 2025)Holistic Agent Leaderboard · Claude Sonnet 4.5 (September 2025)#1Accuracy: 74.55%HAL Generalist Agent
  2. HAL Generalist Agent · Claude Sonnet 4.5 High (September 2025)Holistic Agent Leaderboard · Claude Sonnet 4.5 High (September 2025)#2Accuracy: 70.91%HAL Generalist Agent
  3. HAL Generalist Agent · Claude Opus 4.1 High (August 2025)Holistic Agent Leaderboard · Claude Opus 4.1 High (August 2025)#3Accuracy: 68.48%HAL Generalist Agent
  4. HAL Generalist Agent · Claude Opus 4 High (May 2025)Holistic Agent Leaderboard · Claude Opus 4 High (May 2025)#4Accuracy: 64.85%HAL Generalist Agent
  5. HAL Generalist Agent · Claude-3.7 Sonnet High (February 2025)Holistic Agent Leaderboard · Claude-3.7 Sonnet High (February 2025)#5Accuracy: 64.24%HAL Generalist Agent
  6. HAL Generalist Agent · Claude Opus 4.1 (August 2025)Holistic Agent Leaderboard · Claude Opus 4.1 (August 2025)#6Accuracy: 64.24%HAL Generalist Agent
  7. HF Open Deep Research · GPT-5 Medium (August 2025)Hugging Face · GPT-5 Medium (August 2025)#7Accuracy: 62.80%HF Open Deep Research
  8. HAL Generalist Agent · GPT-5 Medium (August 2025)Holistic Agent Leaderboard · GPT-5 Medium (August 2025)#8Accuracy: 59.39%HAL Generalist Agent
  9. HAL Generalist Agent · o4-mini Low (April 2025)Holistic Agent Leaderboard · o4-mini Low (April 2025)#9Accuracy: 58.18%HAL Generalist Agent
  10. HF Open Deep Research · Claude Opus 4 (May 2025)Hugging Face · Claude Opus 4 (May 2025)#10Accuracy: 57.58%HF Open Deep Research
  11. HAL Generalist Agent · Claude-3.7 Sonnet (February 2025)Holistic Agent Leaderboard · Claude-3.7 Sonnet (February 2025)#11Accuracy: 56.36%HAL Generalist Agent
  12. HAL Generalist Agent · Claude Haiku 4.5 (October 2025)Holistic Agent Leaderboard · Claude Haiku 4.5 (October 2025)#12Accuracy: 56.36%HAL Generalist Agent
  13. HF Open Deep Research · o4-mini High (April 2025)Hugging Face · o4-mini High (April 2025)#13Accuracy: 55.76%HF Open Deep Research
  14. HAL Generalist Agent · o4-mini High (April 2025)Holistic Agent Leaderboard · o4-mini High (April 2025)#14Accuracy: 54.55%HAL Generalist Agent
  15. HF Open Deep Research · GPT-4.1 (April 2025)Hugging Face · GPT-4.1 (April 2025)#15Accuracy: 50.30%HF Open Deep Research