RICERCA OPENGPT

Indice delle evidenze su modelli e agenti di AI

Usa questo indice per passare da una fonte o un fornitore a monte a un modello esatto, un prodotto Agent o un registro di benchmark. Ogni destinazione indica cosa coprono le proprie evidenze e cosa non possono dimostrare.

Fonti delle classifiche pubbliche
2
Fornitori dei modelli
11
Famiglie di modelli
13
Agent categories · Agent benchmarks
7 · 9

Ambito delle evidenze

Questa pagina è un indice delle evidenze pubbliche esistenti e delle identità documentate dai fornitori. L’inclusione non implica l’approvazione di OpenGPT né una posizione universale.

How OpenGPT handles this evidence

L’indice viene generato dallo stesso catalogo di modelli esaminato, dalle istantanee delle classifiche pubbliche, dalla directory proprietaria delle identità degli Agent e dai registri dei benchmark usati dalle classifiche visibili.

Limiti del confronto

  • Fonti diverse misurano oggetti diversi e non devono essere aggregate in un unico punteggio universale.
  • Prima di agire in base a un risultato, è necessario controllare date, versioni e identità della configurazione.
  • OpenGPT organizza le evidenze pubbliche; non sostiene di aver ripetuto ogni valutazione elencata.

Esplora gli hub delle evidenze

Esplora le fonti delle classifiche pubbliche di OpenGPT, i fornitori verificati, le famiglie di modelli, le categorie di Agent e gli ambiti dei benchmark da un unico indice di ricerca esplorabile.

  1. LMArenaFonti delle classifiche pubblicheText Style Control
  2. LiveBenchFonti delle classifiche pubblicheLiveBench-2026-06-25
  3. OpenAIFornitori dei modelli7 Official model IDs
  4. AnthropicFornitori dei modelli6 Official model IDs
  5. GoogleFornitori dei modelli12 Official model IDs
  6. MetaFornitori dei modelli5 Official model IDs
  7. DeepSeekFornitori dei modelli2 Official model IDs
  8. Alibaba QwenFornitori dei modelli12 Official model IDs
  9. Mistral AIFornitori dei modelli6 Official model IDs
  10. xAIFornitori dei modelli5 Official model IDs
  11. CohereFornitori dei modelli8 Official model IDs
  12. MicrosoftFornitori dei modelli5 Official model IDs
  13. Moonshot AIFornitori dei modelli11 Official model IDs
  14. GPTFamiglie di modelli7 Official model IDs
  15. CLAUDEFamiglie di modelli6 Official model IDs
  16. GEMINIFamiglie di modelli7 Official model IDs
  17. LLAMAFamiglie di modelli3 Official model IDs
  18. MUSEFamiglie di modelli2 Official model IDs
  19. DEEPSEEKFamiglie di modelli2 Official model IDs
  20. QWENFamiglie di modelli12 Official model IDs
  21. MISTRALFamiglie di modelli6 Official model IDs
  22. GROKFamiglie di modelli5 Official model IDs
  23. CommandFamiglie di modelli8 Official model IDs
  24. GEMMAFamiglie di modelli5 Official model IDs
  25. PHIFamiglie di modelli5 Official model IDs
  26. KIMIFamiglie di modelli11 Official model IDs
  27. ProgrammazioneCategorie di Agent21 Verified products
  28. Terminale e DevOpsCategorie di Agent7 Verified products
  29. BrowserCategorie di Agent7 Verified products
  30. Uso del computerCategorie di Agent6 Verified products
  31. Strumenti e APICategorie di Agent7 Verified products
  32. RicercaCategorie di Agent9 Verified products
  33. Flusso di lavoro aziendaleCategorie di Agent9 Verified products
  34. SWE-bench VerifiedBenchmark degli AgentVerified · Top 10 published configurations · 500 attività
  35. Terminal-Bench 2.1Benchmark degli Agentterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  36. AssistantBenchBenchmark degli AgentIstantanea HAL verificata · 33 attività pubbliche · 1 scaffold
  37. WebArenaBenchmark degli Agentv0.2.0 · canonical self-hosted environment
  38. OSWorld 2.0Benchmark degli Agenttask version v2026.06.24 · 500-step budget
  39. Berkeley Function-Calling LeaderboardBenchmark degli AgentBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  40. GAIABenchmark degli AgentHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  41. τ²-bench CoreBenchmark degli Agentv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  42. τ³-Banking KnowledgeBenchmark degli Agentv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials