RECHERCHE OPENGPT

Index des preuves relatives aux modèles et agents d’IA

Utilisez cet index pour passer d’une source en amont ou d’un fournisseur à une fiche exacte de modèle, de produit Agent ou de benchmark. Chaque destination indique le périmètre de ses preuves et ce qu’elles ne peuvent pas établir.

Sources des classements publics
2
Fournisseurs de modèles
11
Familles de modèles
13
Agent categories · Agent benchmarks
7 · 9

Périmètre des preuves

Cette page est un index des preuves publiques existantes et des identités documentées par les fournisseurs. L’inclusion n’implique ni recommandation d’OpenGPT ni rang universel.

How OpenGPT handles this evidence

L’index est généré à partir du même catalogue de modèles examiné, des mêmes instantanés de classements publics, du même annuaire propriétaire d’identités Agent et des mêmes fiches de benchmarks que les classements visibles.

Limites de la comparaison

  • Des sources différentes mesurent des objets différents et ne doivent pas être fusionnées dans un score universel.
  • Les dates, les versions et l’identité de la configuration doivent être vérifiées avant d’agir à partir d’un résultat.
  • OpenGPT organise les preuves publiques ; il n’affirme pas avoir réexécuté toutes les évaluations répertoriées.

Parcourir les pôles de preuves

Parcourez les sources de classement publiques d’OpenGPT, les fournisseurs vérifiés, les familles de modèles, les catégories d’Agents et les périmètres de benchmark depuis un index de recherche explorable unique.

  1. LMArenaSources des classements publicsText Style Control
  2. LiveBenchSources des classements publicsLiveBench-2026-06-25
  3. OpenAIFournisseurs de modèles7 Official model IDs
  4. AnthropicFournisseurs de modèles6 Official model IDs
  5. GoogleFournisseurs de modèles12 Official model IDs
  6. MetaFournisseurs de modèles5 Official model IDs
  7. DeepSeekFournisseurs de modèles2 Official model IDs
  8. Alibaba QwenFournisseurs de modèles12 Official model IDs
  9. Mistral AIFournisseurs de modèles6 Official model IDs
  10. xAIFournisseurs de modèles5 Official model IDs
  11. CohereFournisseurs de modèles8 Official model IDs
  12. MicrosoftFournisseurs de modèles5 Official model IDs
  13. Moonshot AIFournisseurs de modèles11 Official model IDs
  14. GPTFamilles de modèles7 Official model IDs
  15. CLAUDEFamilles de modèles6 Official model IDs
  16. GEMINIFamilles de modèles7 Official model IDs
  17. LLAMAFamilles de modèles3 Official model IDs
  18. MUSEFamilles de modèles2 Official model IDs
  19. DEEPSEEKFamilles de modèles2 Official model IDs
  20. QWENFamilles de modèles12 Official model IDs
  21. MISTRALFamilles de modèles6 Official model IDs
  22. GROKFamilles de modèles5 Official model IDs
  23. CommandFamilles de modèles8 Official model IDs
  24. GEMMAFamilles de modèles5 Official model IDs
  25. PHIFamilles de modèles5 Official model IDs
  26. KIMIFamilles de modèles11 Official model IDs
  27. DéveloppementCatégories d’Agents21 Verified products
  28. Terminal et DevOpsCatégories d’Agents7 Verified products
  29. NavigateurCatégories d’Agents7 Verified products
  30. Utilisation de l’ordinateurCatégories d’Agents6 Verified products
  31. Outils et APICatégories d’Agents7 Verified products
  32. RechercheCatégories d’Agents9 Verified products
  33. Processus métierCatégories d’Agents9 Verified products
  34. SWE-bench VerifiedBenchmarks d’AgentsVerified · Top 10 published configurations · 500 tâches
  35. Terminal-Bench 2.1Benchmarks d’Agentsterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  36. AssistantBenchBenchmarks d’AgentsInstantané HAL vérifié · 33 tâches publiques · 1 échafaudage
  37. WebArenaBenchmarks d’Agentsv0.2.0 · canonical self-hosted environment
  38. OSWorld 2.0Benchmarks d’Agentstask version v2026.06.24 · 500-step budget
  39. Berkeley Function-Calling LeaderboardBenchmarks d’AgentsBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  40. GAIABenchmarks d’AgentsHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  41. τ²-bench CoreBenchmarks d’Agentsv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  42. τ³-Banking KnowledgeBenchmarks d’Agentsv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials