Index des preuves relatives aux modèles et agents d’IA
Utilisez cet index pour passer d’une source en amont ou d’un fournisseur à une fiche exacte de modèle, de produit Agent ou de benchmark. Chaque destination indique le périmètre de ses preuves et ce qu’elles ne peuvent pas établir.
- Sources des classements publics
- 2
- Fournisseurs de modèles
- 11
- Familles de modèles
- 13
- Agent categories · Agent benchmarks
- 7 · 9
Périmètre des preuves
Cette page est un index des preuves publiques existantes et des identités documentées par les fournisseurs. L’inclusion n’implique ni recommandation d’OpenGPT ni rang universel.
How OpenGPT handles this evidence
L’index est généré à partir du même catalogue de modèles examiné, des mêmes instantanés de classements publics, du même annuaire propriétaire d’identités Agent et des mêmes fiches de benchmarks que les classements visibles.
Limites de la comparaison
- Des sources différentes mesurent des objets différents et ne doivent pas être fusionnées dans un score universel.
- Les dates, les versions et l’identité de la configuration doivent être vérifiées avant d’agir à partir d’un résultat.
- OpenGPT organise les preuves publiques ; il n’affirme pas avoir réexécuté toutes les évaluations répertoriées.
Parcourir les pôles de preuves
Parcourez les sources de classement publiques d’OpenGPT, les fournisseurs vérifiés, les familles de modèles, les catégories d’Agents et les périmètres de benchmark depuis un index de recherche explorable unique.
- LMArenaSources des classements publicsText Style Control
- LiveBenchSources des classements publicsLiveBench-2026-06-25
- OpenAIFournisseurs de modèles7 Official model IDs
- AnthropicFournisseurs de modèles6 Official model IDs
- GoogleFournisseurs de modèles12 Official model IDs
- MetaFournisseurs de modèles5 Official model IDs
- DeepSeekFournisseurs de modèles2 Official model IDs
- Alibaba QwenFournisseurs de modèles12 Official model IDs
- Mistral AIFournisseurs de modèles6 Official model IDs
- xAIFournisseurs de modèles5 Official model IDs
- CohereFournisseurs de modèles8 Official model IDs
- MicrosoftFournisseurs de modèles5 Official model IDs
- Moonshot AIFournisseurs de modèles11 Official model IDs
- GPTFamilles de modèles7 Official model IDs
- CLAUDEFamilles de modèles6 Official model IDs
- GEMINIFamilles de modèles7 Official model IDs
- LLAMAFamilles de modèles3 Official model IDs
- MUSEFamilles de modèles2 Official model IDs
- DEEPSEEKFamilles de modèles2 Official model IDs
- QWENFamilles de modèles12 Official model IDs
- MISTRALFamilles de modèles6 Official model IDs
- GROKFamilles de modèles5 Official model IDs
- CommandFamilles de modèles8 Official model IDs
- GEMMAFamilles de modèles5 Official model IDs
- PHIFamilles de modèles5 Official model IDs
- KIMIFamilles de modèles11 Official model IDs
- DéveloppementCatégories d’Agents21 Verified products
- Terminal et DevOpsCatégories d’Agents7 Verified products
- NavigateurCatégories d’Agents7 Verified products
- Utilisation de l’ordinateurCatégories d’Agents6 Verified products
- Outils et APICatégories d’Agents7 Verified products
- RechercheCatégories d’Agents9 Verified products
- Processus métierCatégories d’Agents9 Verified products
- SWE-bench VerifiedBenchmarks d’AgentsVerified · Top 10 published configurations · 500 tâches
- Terminal-Bench 2.1Benchmarks d’Agentsterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchBenchmarks d’AgentsInstantané HAL vérifié · 33 tâches publiques · 1 échafaudage
- WebArenaBenchmarks d’Agentsv0.2.0 · canonical self-hosted environment
- OSWorld 2.0Benchmarks d’Agentstask version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardBenchmarks d’AgentsBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIABenchmarks d’AgentsHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreBenchmarks d’Agentsv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeBenchmarks d’Agentsv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials