Décisions indépendantes sur les modèles

Classement des modèles d’IA

Présélectionnez des versions exactes de modèles à partir des preuves publiques, comparez-les selon une même base, puis vérifiez votre choix sur votre propre tâche.

Tâches objectivesLiveBench · 3 sur 10 affichées
  1. Classement 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. Classement 2Claude Fable 5 Max EffortAnthropic82.97
  3. Classement 3GPT-6 Astra Max EffortOpenAI82.16
Données issues d’évaluations publiées2 sources publiques externesLiveBench · Données de cette édition jusqu’au

OpenGPT organise et présente des données publiques d’évaluations tierces ; il n’a pas retesté ces modèles. Utilisez le classement pour comprendre leurs performances relatives, puis validez les candidats sur vos propres tâches.

Édition des données
2026-09Publié ·
Périmètre de la décision automatisée
20 dans la vérification automatisée / 79 modèles du catalogueDate limite des données · 2026-08-30
Instantané actuel du classement · LiveBench
2026-09-07 · 56 enregistrements source
Dernière édition présentant une évolution comparable · LiveBench
Inconnu
Couverture du cycle de vie
36 états de cycle de vie documentés / 79 · 20 dans le périmètre de l’automatisationDate limite des données · 2026-08-30

Choisissez un angle de classement

Commencer par la décision à prendre. Chaque scénario ouvre l’indicateur de classement publié le plus pertinent. La source et l’échelle d’origine restent visibles.

Choisissez les éléments à afficher

Affiche tous les enregistrements publiés avec l’ID ou le nom du modèle source, y compris les alias et configurations. Les rangs de la source sont conservés.

Tâches objectives. Score global LiveBench portant sur 23 tâches notées objectivement dans sept catégories.

10 sur 10 affichées. Tâches objectives.

  1. Classement 1
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    claude-fable-5-1-max-effort
    Tâches objectives
    83.41
    Source originale
  2. Classement 2
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    claude-fable-5-max-effort
    Tâches objectives
    82.97
    Source originale
  3. Classement 3
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    gpt-6-astra-max
    Tâches objectives
    82.16
    Source originale
  4. Classement 4
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    muse-spark-1.3-xhigh
    Tâches objectives
    81.59
    Source originale
  5. Classement 5
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    gpt-5.6-sol-max
    Tâches objectives
    81.05
    Source originale
  6. Classement 6
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    gpt-5.5-xhigh
    Tâches objectives
    80.19
    Source originale
  7. Classement 7
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    claude-opus-5-max-effort
    Tâches objectives
    80.08
    Source originale
  8. Classement 8

    Kimi K3

    Moonshot AI
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    kimi-k3
    Tâches objectives
    79.19
    Source originale
  9. Classement 9
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    gemini-3.7-flash-high
    Tâches objectives
    78.83
    Source originale
  10. Classement 10
    Paramètres du modèle
    Published benchmark configuration
    ID du modèle dans la source
    qwen3.8-max
    Tâches objectives
    78.46
    Source originale
Source indépendanteLiveBench10 entrées publiées · Date de collecte: 9 sept. 2026
LiveBench

État de la surveillanceStatut en direct indisponiblePublication automatique validée

Date des données source
Récupéré par OpenGPT
Dernière modification du classement

LMArena + LiveBench : publication automatique validée · Sources suspendues : historique uniquement

Méthode de classementChaque vue conserve la métrique, la version et la méthodologie de la source. Suivez les liens pour auditer le travail sous-jacent.

Base du classement

Classement publié complet et ID officiels des modèles

Le classement principal conserve chaque fiche d’éditeur et affiche l’ID de modèle ou le nom indiqué par la source. Chaque ligne peut être comparée : les correspondances exactes et sûres du point de vue de la configuration utilisent les versions officielles ; toutes les autres restent dans un même classement publié. Les données manquantes ne deviennent jamais un score nul.
79 ID officiels de modèles
79
0 avec des données publiques de classement
0
79 en attente de données comparables
79
LiveBench · 56 enregistrements source conservés pour audit
56
Répertoire des modèles

Base du classement

Comment lire cette édition de recherche

  • Les scores restent sur les échelles d’origine de leur éditeur. Ils ne sont pas combinés en un score composite.

  • L’absence de données ne signifie pas zéro. Elle signifie que l’éditeur n’a pas publié cette métrique pour cet instantané.

  • Lorsqu’une source indique les paramètres du modèle, le classement vaut pour cette configuration exacte et cette version de la source — pas pour toutes les tâches, régions ou modalités de déploiement.

  • Aucun fournisseur ne peut payer pour obtenir une place. OpenGPT renvoie directement aux preuves utilisées.

Base du classement

Données et sources

Chaque vue conserve la métrique, la version et la méthodologie de la source. Suivez les liens pour auditer le travail sous-jacent.
AR

LMArena

Le dernier classement global complet avec contrôle du style, fondé sur des utilisateurs comparant côte à côte deux réponses de modèles.

Date de publication du classement
2 sept. 2026
Date de collecte
9 sept. 2026
Licence
CC BY 4.0

Classement d’origineMéthodologie

LB

LiveBench

Vingt-trois tâches objectives réparties en sept catégories ; les questions sont renouvelées tous les six mois.

Version des données
LiveBench-2026-06-25
Date de collecte
9 sept. 2026
Licence
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

Classement d’origineMéthodologie

Version de la méthode

Un rythme de publication prévisible

OpenGPT contrôle les sources actives de modèles toutes les six heures. LMArena et LiveBench ne sont publiés qu’après validation de leurs politiques versionnées. Les sources suspendues restent historiques et ne figurent pas dans les classements actuels.
  1. 01

    Vérification des sources toutes les 6 h

    Les mises à jour de LMArena et LiveBench ne sont publiées automatiquement qu’après les contrôles du schéma, de l’exhaustivité, de la date, de l’intégrité et des anomalies. Les sources suspendues restent historiques.

  2. 02

    Synthèse hebdomadaire des changements

    Regroupe les changements importants de classement, de modèles et de sources dans une mise à jour vérifiable.

  3. 03

    Instantané historique mensuel

    Fige un instantané daté avec les configurations exactes, les versions des sources et les corrections.