Indice delle evidenze su modelli e agenti di AI
Usa questo indice per passare da una fonte o un fornitore a monte a un modello esatto, un prodotto Agent o un registro di benchmark. Ogni destinazione indica cosa coprono le proprie evidenze e cosa non possono dimostrare.
- Fonti delle classifiche pubbliche
- 2
- Fornitori dei modelli
- 11
- Famiglie di modelli
- 13
- Agent categories · Agent benchmarks
- 7 · 9
Ambito delle evidenze
Questa pagina è un indice delle evidenze pubbliche esistenti e delle identità documentate dai fornitori. L’inclusione non implica l’approvazione di OpenGPT né una posizione universale.
How OpenGPT handles this evidence
L’indice viene generato dallo stesso catalogo di modelli esaminato, dalle istantanee delle classifiche pubbliche, dalla directory proprietaria delle identità degli Agent e dai registri dei benchmark usati dalle classifiche visibili.
Limiti del confronto
- Fonti diverse misurano oggetti diversi e non devono essere aggregate in un unico punteggio universale.
- Prima di agire in base a un risultato, è necessario controllare date, versioni e identità della configurazione.
- OpenGPT organizza le evidenze pubbliche; non sostiene di aver ripetuto ogni valutazione elencata.
Esplora gli hub delle evidenze
Esplora le fonti delle classifiche pubbliche di OpenGPT, i fornitori verificati, le famiglie di modelli, le categorie di Agent e gli ambiti dei benchmark da un unico indice di ricerca esplorabile.
- LMArenaFonti delle classifiche pubblicheText Style Control
- LiveBenchFonti delle classifiche pubblicheLiveBench-2026-06-25
- OpenAIFornitori dei modelli7 Official model IDs
- AnthropicFornitori dei modelli6 Official model IDs
- GoogleFornitori dei modelli12 Official model IDs
- MetaFornitori dei modelli5 Official model IDs
- DeepSeekFornitori dei modelli2 Official model IDs
- Alibaba QwenFornitori dei modelli12 Official model IDs
- Mistral AIFornitori dei modelli6 Official model IDs
- xAIFornitori dei modelli5 Official model IDs
- CohereFornitori dei modelli8 Official model IDs
- MicrosoftFornitori dei modelli5 Official model IDs
- Moonshot AIFornitori dei modelli11 Official model IDs
- GPTFamiglie di modelli7 Official model IDs
- CLAUDEFamiglie di modelli6 Official model IDs
- GEMINIFamiglie di modelli7 Official model IDs
- LLAMAFamiglie di modelli3 Official model IDs
- MUSEFamiglie di modelli2 Official model IDs
- DEEPSEEKFamiglie di modelli2 Official model IDs
- QWENFamiglie di modelli12 Official model IDs
- MISTRALFamiglie di modelli6 Official model IDs
- GROKFamiglie di modelli5 Official model IDs
- CommandFamiglie di modelli8 Official model IDs
- GEMMAFamiglie di modelli5 Official model IDs
- PHIFamiglie di modelli5 Official model IDs
- KIMIFamiglie di modelli11 Official model IDs
- ProgrammazioneCategorie di Agent21 Verified products
- Terminale e DevOpsCategorie di Agent7 Verified products
- BrowserCategorie di Agent7 Verified products
- Uso del computerCategorie di Agent6 Verified products
- Strumenti e APICategorie di Agent7 Verified products
- RicercaCategorie di Agent9 Verified products
- Flusso di lavoro aziendaleCategorie di Agent9 Verified products
- SWE-bench VerifiedBenchmark degli AgentVerified · Top 10 published configurations · 500 attività
- Terminal-Bench 2.1Benchmark degli Agentterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchBenchmark degli AgentIstantanea HAL verificata · 33 attività pubbliche · 1 scaffold
- WebArenaBenchmark degli Agentv0.2.0 · canonical self-hosted environment
- OSWorld 2.0Benchmark degli Agenttask version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardBenchmark degli AgentBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIABenchmark degli AgentHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreBenchmark degli Agentv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeBenchmark degli Agentv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials