Aucun modèle ne satisfait toutes les exigences
Examinez l’exigence qui a exclu chaque candidat, puis n’assouplissez qu’une contrainte réellement flexible.
Examiner les exigencesTrouvez le processus adapté, suivez chaque étape et comprenez ce que le résultat peut ou ne peut pas vous apprendre.
Chaque processus répond à une question différente. Commencez par l’objectif le plus proche, puis suivez le guide associé.
Découvrez les éléments classés, l’origine des données et les fiches qui comportent un ID de modèle officiel.
Utilisez chaque angle de classement pour examiner les indicateurs publiés, consulter les fiches sources et établir une présélection à tester sur des tâches réelles.
Commencez par la question à laquelle vous devez répondre. Les préférences des utilisateurs, les capacités globales, les tâches objectives, le coût et les classements des poids ouverts utilisent des sources et des échelles différentes.
Un rang est relatif à une source et à un périmètre. Les ex æquo peuvent entraîner des sauts de numéros et les scores issus de différents angles de classement ne sont pas directement comparables.
OpenGPT organise les données publiques tierces et n’a pas réexécuté ces évaluations. Aucun classement ne désigne le meilleur modèle pour chaque utilisateur ou chaque tâche.
Chaque ligne comporte désormais les détails du modèle et une action de comparaison. OpenGPT ajoute un ID de modèle officiel uniquement lorsque la documentation du fournisseur prouve la correspondance exacte ; dans le cas contraire, la comparaison des fiches sources conserve le nom de l’éditeur, la configuration et les données de classement, sans inventer de nouvel ID officiel.
Choisissez un agent selon la tâche, la configuration complète, la qualité des preuves et les résultats comparables.
Explorez 96 configurations publiées d’évaluation des Agents dans sept périmètres de tâches, ainsi que 109 résultats distincts de modèles BFCL pour l’appel d’outils, sans réduire des preuves incompatibles à un score unique.
Le résultat d’un agent appartient à une configuration complète : modèle de base, scaffold, outils, autorisations, budget, environnement, version du benchmark et date. OpenGPT conserve les champs déclarés par la source et laisse les champs manquants non renseignés au lieu de les considérer comme nuls.
Un rang décrit une configuration système complète dans le périmètre d’un benchmark. Interprétez-le avec le niveau de preuve, la fraîcheur, le nombre d’échantillons ou d’exécutions et les éventuels champs de coût et de fiabilité indiqués.
OpenGPT ne crée aucun score Agent universel. Sauf si un résultat est explicitement marqué comme reproduit, OpenGPT organise les preuves en amont au lieu de réexécuter l’évaluation ; aucun benchmark ne prouve qu’un produit est prêt pour tous les processus de production.
Un scaffold, une version de modèle, un ensemble d’outils, un niveau d’autorisation, un budget ou un paramètre de benchmark différent crée une configuration d’agent distincte qui doit rester un enregistrement séparé.
Envoyez une fiche publique d’identité ou de preuve pour examen sans modifier les classements.
Utilisez le processus de soumission lorsqu’un ID de modèle officiel ou un produit Agent est manquant, ou lorsqu’une source publique nécessite un examen éditorial.
Connectez-vous avec un compte vérifié et préparez une source HTTPS publique. Ne transmettez jamais d’identifiants, de fichiers privés ou d’informations personnelles.
Une soumission réussie reçoit un numéro de référence et entre dans la file de vérification. Un produit Agent approuvé est un enregistrement de l’annuaire public, et non un rang dans le classement ni une recommandation d’OpenGPT.
Les soumissionnaires ne peuvent définir ni le rang, ni la qualité des preuves, ni la comparabilité, ni l’état de publication. Les contrôles des doublons et les limites de débit réduisent les abus, et une approbation ne modifie jamais automatiquement un classement.
Les produits Agent approuvés peuvent être recherchés dans l’annuaire, mais leur classement nécessite toujours des preuves d’évaluation publiques comparables.
Suivez les évolutions entre des instantanés comparables et comparez les ID des modèles du catalogue.
Utilisez cette page pour connaître les évolutions depuis l’instantané précédent de la source, les nouvelles entrées, les différences entre versions exactes et la date de récupération des données.
L’évolution historique s’appuie actuellement sur le périmètre des préférences utilisateur de LMArena. Les autres sources actives restent limitées à leur état actuel tant qu’un instantané antérieur comparable n’est pas disponible.
OpenGPT calcule les évolutions uniquement lorsque la source, le périmètre, l’unité et la méthode concordent, et conserve des instantanés mensuels téléchargeables.
Seules les dates de sortie documentées par le fournisseur sont reconnues comme sorties de produit. La comparaison des versions ne déduit ni la vitesse, ni le prix, ni la longueur du contexte, ni la qualité à partir des noms.
OpenGPT n’a pas figé d’édition antérieure comparable pour cette source active. Les sources suspendues restent historiques au lieu de contribuer à l’évolution actuelle.
Partez d’un scénario de travail réel et examinez trois versions officielles de modèles à tester en priorité.
Utilisez les classements par tâche pour transformer de vastes indicateurs publics en une petite présélection pratique pour le développement, la recherche, les documents, l’assistance, les travaux multilingues ou multimodaux, le coût, la confidentialité ou la vitesse.
Choisissez la tâche la plus proche de votre travail, puis notez vos prompts réels, vos données, vos outils, votre région, votre budget et vos exigences de confidentialité. Les preuves publiques affichées peuvent couvrir un périmètre plus large que votre tâche.
Vous obtenez trois candidats de départ officiels, les preuves publiques disponibles et des accès directs pour les comparer ou effectuer un test sur une tâche réelle.
Un classement par tâche est une première présélection, et non un classement universel ou une preuve du meilleur modèle. L’absence de preuve ne vaut pas zéro et des sources publiques différentes ne sont pas combinées en un seul score.
Une version officielle peut être pertinente pour la tâche en raison du positionnement du produit ou du type de déploiement, même lorsqu’aucun résultat de la version exacte n’est associé dans la source publique sélectionnée. L’absence de preuve reste visible et doit être résolue par votre propre test.
Définissez les modèles que vous utilisez, vos travaux récurrents et vos priorités, puis examinez des indicateurs prudents pour déterminer quand une comparaison équitable est pertinente.
Utilisez Radar pour répondre à une question concrète : existe-t-il suffisamment de preuves publiques comparables pour tester une alternative au modèle que vous utilisez actuellement ?
Choisissez les versions officielles exactes, au moins une tâche récurrente et jusqu’à deux priorités. Utilisez le même navigateur et le même appareil, car la configuration reste locale.
Radar crée un contrôle de mise à niveau local à l’appareil avec un modèle actuel, une alternative adaptée à la tâche lorsqu’elle existe, la date des preuves, les limites de l’incertitude et des actions de comparaison directe.
Une vérification de mise à niveau ne constitue pas une instruction de changer. Le coût, la vitesse, la confidentialité ou le contexte peuvent encore exiger des tests directs, et les paramètres locaux ne sont ni synchronisés ni sauvegardés.
Non. Cela signifie qu’un indicateur comparable ou une modification du cycle de vie justifie un test sur la même tâche. Ne changez qu’après la réussite de l’alternative sur votre travail réel et selon vos contraintes.
Transformez quatre exigences concrètes en une présélection explicable.
Utilisez l’outil de recherche lorsque vous savez quelle tâche accomplir, mais ignorez encore quelle série de modèles examiner en priorité.
Déterminez la tâche principale, l’endroit où le modèle peut s’exécuter, votre priorité d’exploitation principale et toute exigence linguistique.
Le libellé qualitatif et le nombre d’exigences satisfaites s’appliquent à la série de modèles, et non aux versions individuelles ; ni l’un ni l’autre ne constitue un score de benchmark. Vérifiez la disponibilité au déploiement de chaque version actuelle répertoriée et comparez les candidats sur les mêmes tâches.
L’outil de recherche ne fait appel à aucun modèle, ne vérifie pas les tarifs actuels et ne désigne pas de vainqueur universel. Une série de modèles peut comprendre des versions aux fonctionnalités différentes.
L’ordre reflète les contraintes que vous avez sélectionnées, et non la popularité générale. Modifiez une exigence pour identifier la cause du résultat, puis testez les versions exactes.
Parcourez les ID de modèles documentés par les fournisseurs, ouvrez leurs pages détaillées et vérifiez si des données de classement publiques comparables existent.
Utilisez l’annuaire lorsque vous avez besoin d’un ID de modèle officiel exact, de la destination du fournisseur, des tâches adaptées et inadaptées, des sources et d’un état clair des données de classement.
Saisissez un nom de modèle, un fournisseur, un besoin de déploiement ou une tâche. Un ID de modèle documenté par le fournisseur ne garantit pas la disponibilité de données d’évaluation publiques comparables.
« Classé » signifie que des données publiées comparables sont associées à l’ID exact du modèle. « Non classé » signifie que cette édition ne contient aucune fiche comparable appropriée ; il ne s’agit pas d’un score nul.
La documentation du fournisseur établit l’identité dans le catalogue, et non la disponibilité actuelle dans chaque pays ou niveau de service. La couverture des classements, les détails des modèles et les conditions des fournisseurs peuvent évoluer après la date d’examen.
Non. Cela signifie que cette édition ne dispose pas de données publiques comparables adaptées à cet ID de modèle. Testez-le directement s’il reste pertinent pour votre décision.
Comparez deux à quatre versions officielles exactes ou des fiches provenant d’une même vue de classement publiée.
La comparaison des versions officielles organise les ID documentés par les fournisseurs à partir des sources publiées. La comparaison des fiches sources conserve le nom et les paramètres de l’éditeur lorsqu’une comparaison officielle exacte entraînerait une perte d’informations.
Pour les versions officielles, choisissez deux à quatre ID du catalogue. Pour les fiches sources, choisissez deux à quatre lignes provenant de la même source, de la même dimension et du même instantané.
La comparaison crée une présélection tenant compte des preuves et indique les informations manquantes. Elle ne produit pas de nouveau score de benchmark et ne désigne pas de vainqueur universel.
OpenGPT ne fait pas appel aux modèles dans cette vue. Les scores publiés provenant de sources ou de périmètres différents ne sont pas interchangeables, et les détails des modèles peuvent évoluer après leur date d’examen.
La comparaison de données synthétise les informations déjà publiées pour deux à quatre modèles. L’évaluation sur des tâches réelles porte sur exactement deux versions, vous demande d’exécuter les mêmes prompts dans les deux services et examine les réponses collées en masquant les libellés visibles des modèles.
Conservez dans ce navigateur une courte liste de travail d’entrées de classement.
Utilisez Mes modèles pour revenir rapidement aux candidats, ouvrir des destinations fiables et ajouter à une comparaison les ID de modèles pris en charge.
Utilisez le même navigateur et le même appareil. La liste est stockée localement, sans compte OpenGPT ni synchronisation dans le cloud.
Le nombre affiché à côté de Mes modèles indique combien d’entrées sont enregistrées. L’identité source et l’identité officielle du modèle restent distinctes.
Cette liste n’est ni un compte, ni une synchronisation de favoris, ni une sauvegarde. Aucun autre navigateur ou appareil ne la verra ; la navigation privée, les restrictions de stockage ou l’effacement des données du site peuvent la supprimer.
Vérifiez que vous utilisez le même profil de navigateur et le même appareil. Si le stockage du site a été effacé ou bloqué, OpenGPT ne peut pas restaurer la liste locale.
Effectuez un essai privé sur des tâches réelles ; le mode temporaire conserve les résultats bruts en mémoire, sauf si vous décidez de les enregistrer sur cet appareil.
Comparez 2 à 4 configurations exactes de Modèle ou d’Agent à l’aide d’un jeu de tâches unique, contrôlé et auditable.
Consignez chaque configuration exacte, ouvrez les services concernés du fournisseur, retirez les données sensibles et gardez à l’esprit que les politiques du fournisseur s’appliquent à tout ce que vous lui transmettez.
Le résultat est une issue confirmée par l’utilisateur, liée au jeu de tâches figé et aux configurations consignées. L’exportation des seules métadonnées est l’option par défaut ; l’exportation complète des données brutes exige un consentement explicite et peut être contrôlée par le vérificateur local.
Le masquage des libellés réduit le biais lié à la visibilité des noms, mais ne constitue pas un double aveugle. OpenGPT n’exécute pas les services des fournisseurs et ne prouve ni l’origine des résultats, ni l’exactitude de la configuration, ni l’exhaustivité, ni la confidentialité chez les fournisseurs externes, ni la généralisation au-delà de ces tâches. Les résultats des essais privés sont « Testés sur votre travail », pas des preuves publiques.
L’essai s’exécute dans votre navigateur. Le mode temporaire conserve les résultats bruts en mémoire ; leur conservation sur cet appareil est facultative. L’exportation des métadonnées exclut les résultats bruts, et leur exportation complète exige un consentement explicite.
Réutilisez les mêmes prompts réels dans une évaluation ultérieure des modèles sans reconstruire l’ensemble de tâches.
Utilisez les ensembles de tâches enregistrés afin de rendre les futures comparaisons plus cohérentes et de réévaluer les versions exactes des modèles après une nouvelle version ou un changement des données publiques.
Complétez les titres et les prompts des tâches, choisissez un nom clair pour l’ensemble de tâches et utilisez le même navigateur et le même appareil. Un ensemble de tâches peut contenir du texte sensible ; retirez donc les données privées avant de l’enregistrer.
Le nom, le modèle, la langue, les titres et les prompts de l’ensemble de tâches sont stockés localement pour être réutilisés. La réévaluation démarre une nouvelle exécution tout en conservant les entrées de test prévues.
Les ensembles de tâches enregistrés n’existent que sur cet appareil : ils ne sont ni synchronisés ni sauvegardés ailleurs. Les réponses, choix de modèles, examens, rapports et clés API ne sont pas enregistrés dans un ensemble de tâches. L’effacement des données du site peut supprimer tous les ensembles enregistrés.
OpenGPT conserve les mêmes tâches et les versions exactes des modèles, puis efface les réponses, les scores, les jugements, l’état d’affichage et le rapport précédents afin que la prochaine exécution soit indépendante de l’ancien résultat.
Vérifiez la structure et la cohérence interne des rapports JSON pris en charge, recherchez les motifs de secrets et générez une empreinte locale.
Utilisez le vérificateur pour examiner un paquet OpenGPT Evidence v1 ou v2, ou un rapport V3 téléchargé depuis l’Espace décisionnel. Chaque contrôle s’exécute localement dans ce navigateur.
Obtenez le fichier JSON d’origine. Pour un rapport de comparaison, téléchargez-le depuis l’Espace décisionnel ; terminez d’abord chaque cas si vous avez besoin d’un résultat achevé plutôt que d’un brouillon.
Pour Evidence v1/v2, « Réussi » signifie que le paquet respecte les règles prises en charge en matière de structure et de cohérence, tandis que « Démonstration » signale un exemple. Pour un rapport de comparaison, « Réussi » signifie qu’un rapport terminé est cohérent en interne ; « Brouillon » signifie que sa structure est valide mais que la comparaison est inachevée. « Échec » signifie qu’au moins un contrôle obligatoire doit être examiné.
Une validation ne prouve ni que le modèle désigné a produit les réponses collées, ni que les affirmations du fournisseur sont exactes, ni que le résultat se généralise au-delà des tests enregistrés. Les résultats de fichiers sans rapport ne sont pas automatiquement comparables.
Non. Cela confirme uniquement que le rapport pris en charge est structurellement valide et cohérent en interne. Vous devez encore juger l’identité du modèle, la qualité du test, les résultats et la pertinence de la décision.
Découvrez ce qui rend une décision sur un modèle vérifiable et reproductible.
Consultez cette page avant de concevoir, de publier ou d’utiliser une évaluation. Elle distingue la qualité des preuves de la popularité des modèles.
Commencez par une question de décision concrète, des versions de modèles nommées, des tâches représentatives et un plan de conservation des résultats bruts.
Evidence v1/v2 vérifie principalement le format et les déclarations. L’Espace décisionnel V3 prend en charge le recalcul local (L3) ; la reproduction indépendante L4 reste non prise en charge.
Un processus rigoureux peut réduire les biais, mais ne peut garantir qu’un échantillon représente chaque utilisateur, chaque langue, les versions futures ou les conditions de production.
Adaptez la rigueur aux conséquences. Un essai personnel peut se contenter de L1 ; une affirmation publique ou à forts enjeux doit rechercher des preuves indépendantes plus solides.
Utilisez ces définitions lorsqu’un libellé ne vous est pas familier.
Examinez l’exigence qui a exclu chaque candidat, puis n’assouplissez qu’une contrainte réellement flexible.
Examiner les exigencesL’éditeur peut utiliser des rangs ex æquo ou plusieurs configurations. OpenGPT conserve la position d’origine au lieu de renuméroter les lignes visibles.
Examiner le classementLa source n’a publié aucune valeur comparable. OpenGPT la laisse non déclarée au lieu de l’assimiler à zéro ; comparez uniquement des valeurs relevant du même périmètre de benchmark.
Examiner les preuves relatives aux AgentsIl s’agit d’une fiche source complète, pas d’un état non résolu. Ouvrez la source d’origine ; utilisez l’annuaire des modèles lorsque vous avez besoin d’une identité documentée par le fournisseur et d’un accès officiel.
Examiner l’identité de la sourceUtilisez le même profil de navigateur et le même appareil. Le mode privé, le blocage du stockage ou l’effacement des données du site peuvent supprimer la liste locale.
Ouvrir Mes modèlesLa comparaison de données accepte les ID de modèles du catalogue. Le même modèle est peut-être déjà sélectionné ou la liste a peut-être atteint sa limite de quatre modèles. Choisissez une autre version du catalogue ou retirez d’abord un candidat.
Ouvrir l’annuaire des modèlesRevenez à l’essai et renseignez, pour chaque paire configuration-tâche obligatoire, le résultat, l’état d’examen, le contrôle des échecs critiques et l’issue confirmée par l’utilisateur.
Continuer dans Proof LabRevenez à Comparer, examinez l’avertissement relatif au brouillon local plus récent, puis choisissez délibérément de conserver ou de réinitialiser le brouillon.
Examiner le brouillon localUtilisez l’élément en échec de la liste de contrôle pour corriger la fiche source. N’insérez aucun secret et ne réécrivez pas les résultats.
Ouvrir le vérificateurSignalez un lien rompu, un détail de modèle incorrect ou un problème que vous n’avez pas pu résoudre.