Sources des classements publics
Données de classement des modèles d’IA de LiveBench
OpenGPT conserve 30 fiches LiveBench publiées dans le périmètre de leur source d’origine. Il ne réexécute pas ce classement et ne le fusionne pas avec un autre benchmark.
- Fiches publiées
- 30
- Vues du classement
- Objective tasks · Cost per score point · Open-weight models
- Date des données sources
- Récupéré
Périmètre des preuves
LiveBench-2026-06-25. 51 configurations de modèles publiées sur vingt-trois tâches objectives et sept catégories ; les questions sont actualisées tous les six mois.
How OpenGPT handles this evidence
OpenGPT stocke les libellés, positions, configurations, dates et valeurs de l’éditeur au sein du même périmètre publié. Il ne convertit pas les valeurs manquantes en zéros et ne fusionne pas cette source dans un score couvrant plusieurs sources.
Limites de la comparaison
- Les rangs et les valeurs ne sont comparables qu’au sein de la version et du périmètre de classement nommés de la source.
- Une configuration répertoriée par la source n’est liée à un ID officiel de modèle qu’après vérification des preuves d’identité.
- Les classements publiés sont des indicateurs de présélection ; tout choix de production exige encore de tester la version exacte sur des tâches réelles.
LiveBench-2026-06-25
Affichage de 18 lignes représentatives issues de 30 fiches publiées. Ouvrez une ligne pour examiner son identité source exacte et ses preuves de correspondance.
- Claude Fable 5.1 Max EffortAnthropic · Objective tâches#183.41Published benchmark configuration
- Claude Fable 5 Max EffortAnthropic · Objective tâches#282.97Published benchmark configuration
- GPT-6 Astra Max EffortOpenAI · Objective tâches#382.16Published benchmark configuration
- Muse Spark 1.3 xHigh EffortMeta · Objective tâches#481.59Published benchmark configuration
- GPT-5.6 Sol Max EffortOpenAI · Objective tâches#581.05Published benchmark configuration
- GPT-5.5 Thinking xHigh EffortOpenAI · Objective tâches#680.19Published benchmark configuration
- Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
- GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
- Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
- DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
- DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
- DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
- Kimi K3Moonshot AI · Open-weight models#179.19Ouvrir les poids
- Qwen 3.8 MaxAlibaba · Open-weight models#278.46Ouvrir les poids
- DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Ouvrir les poids
- DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Ouvrir les poids
- Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Ouvrir les poids
- GLM-5.3Z.AI · Open-weight models#676.14Ouvrir les poids