Sources des classements publics

Données de classement des modèles d’IA de LiveBench

OpenGPT conserve 30 fiches LiveBench publiées dans le périmètre de leur source d’origine. Il ne réexécute pas ce classement et ne le fusionne pas avec un autre benchmark.

Fiches publiées
30
Vues du classement
Objective tasks · Cost per score point · Open-weight models
Date des données sources
Récupéré

Périmètre des preuves

LiveBench-2026-06-25. 51 configurations de modèles publiées sur vingt-trois tâches objectives et sept catégories ; les questions sont actualisées tous les six mois.

How OpenGPT handles this evidence

OpenGPT stocke les libellés, positions, configurations, dates et valeurs de l’éditeur au sein du même périmètre publié. Il ne convertit pas les valeurs manquantes en zéros et ne fusionne pas cette source dans un score couvrant plusieurs sources.

Limites de la comparaison

  • Les rangs et les valeurs ne sont comparables qu’au sein de la version et du périmètre de classement nommés de la source.
  • Une configuration répertoriée par la source n’est liée à un ID officiel de modèle qu’après vérification des preuves d’identité.
  • Les classements publiés sont des indicateurs de présélection ; tout choix de production exige encore de tester la version exacte sur des tâches réelles.

LiveBench-2026-06-25

Affichage de 18 lignes représentatives issues de 30 fiches publiées. Ouvrez une ligne pour examiner son identité source exacte et ses preuves de correspondance.

  1. Claude Fable 5.1 Max EffortAnthropic · Objective tâches#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · Objective tâches#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · Objective tâches#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · Objective tâches#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · Objective tâches#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · Objective tâches#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · Open-weight models#179.19Ouvrir les poids
  14. Qwen 3.8 MaxAlibaba · Open-weight models#278.46Ouvrir les poids
  15. DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Ouvrir les poids
  16. DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Ouvrir les poids
  17. Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Ouvrir les poids
  18. GLM-5.3Z.AI · Open-weight models#676.14Ouvrir les poids