LMArena
Le dernier classement global complet avec contrôle du style, fondé sur des utilisateurs comparant côte à côte deux réponses de modèles.
- Date de publication du classement
- 2 sept. 2026
- Date de collecte
- 9 sept. 2026
- Licence
- CC BY 4.0
Décisions indépendantes sur les modèles
Présélectionnez des versions exactes de modèles à partir des preuves publiques, comparez-les selon une même base, puis vérifiez votre choix sur votre propre tâche.
OpenGPT organise et présente des données publiques d’évaluations tierces ; il n’a pas retesté ces modèles. Utilisez le classement pour comprendre leurs performances relatives, puis validez les candidats sur vos propres tâches.
Commencer par la décision à prendre. Chaque scénario ouvre l’indicateur de classement publié le plus pertinent. La source et l’échelle d’origine restent visibles.
Affiche tous les enregistrements publiés avec l’ID ou le nom du modèle source, y compris les alias et configurations. Les rangs de la source sont conservés.
Tâches objectives. Score global LiveBench portant sur 23 tâches notées objectivement dans sept catégories.
10 sur 10 affichées. Tâches objectives.
Base du classement
Base du classement
Les scores restent sur les échelles d’origine de leur éditeur. Ils ne sont pas combinés en un score composite.
L’absence de données ne signifie pas zéro. Elle signifie que l’éditeur n’a pas publié cette métrique pour cet instantané.
Lorsqu’une source indique les paramètres du modèle, le classement vaut pour cette configuration exacte et cette version de la source — pas pour toutes les tâches, régions ou modalités de déploiement.
Aucun fournisseur ne peut payer pour obtenir une place. OpenGPT renvoie directement aux preuves utilisées.
Base du classement
Le dernier classement global complet avec contrôle du style, fondé sur des utilisateurs comparant côte à côte deux réponses de modèles.
Vingt-trois tâches objectives réparties en sept catégories ; les questions sont renouvelées tous les six mois.
Version de la méthode
Les mises à jour de LMArena et LiveBench ne sont publiées automatiquement qu’après les contrôles du schéma, de l’exhaustivité, de la date, de l’intégrité et des anomalies. Les sources suspendues restent historiques.
Regroupe les changements importants de classement, de modèles et de sources dans une mise à jour vérifiable.
Fige un instantané daté avec les configurations exactes, les versions des sources et les corrections.