GUIDES ET ASSISTANCE

Centre d’aide OpenGPT

Trouvez le processus adapté, suivez chaque étape et comprenez ce que le résultat peut ou ne peut pas vous apprendre.

Commencer par ce que vous souhaitez faire

Chaque processus répond à une question différente. Commencez par l’objectif le plus proche, puis suivez le guide associé.

1Classements des modèlesComprendre les indicateurs publiés et l’état de l’identité.2Classements des AgentsChoisissez des configurations d’agents complètes selon la tâche et les preuves.3ChoisirAffinez les candidats à partir des exigences réelles.4Comparer les données publiquesPlacez côte à côte deux à quatre ID de modèles du catalogue.5Enregistrer les modèlesConservez une sélection locale dans ce navigateur.6Effectuer un essai Proof LabTestez 2 à 4 configurations exactes de Modèle ou d’Agent sur un même jeu de tâches figé.7Soumettre ou corriger des preuvesEnvoyez une source publique de modèle ou d’Agent pour examen éditorial.8Vérifier un rapportVérifiez localement un rapport JSON OpenGPT avant de le partager.

01

Classements des modèles d’IA

Découvrez les éléments classés, l’origine des données et les fiches qui comportent un ID de modèle officiel.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez chaque angle de classement pour examiner les indicateurs publiés, consulter les fiches sources et établir une présélection à tester sur des tâches réelles.

Avant de commencer

Commencez par la question à laquelle vous devez répondre. Les préférences des utilisateurs, les capacités globales, les tâches objectives, le coût et les classements des poids ouverts utilisent des sources et des échelles différentes.

Tutoriel pas à pas

  1. 1Choisissez l’angle de classement qui correspond à votre décision.
  2. 2Utilisez Classement source complet pour toutes les fiches d’éditeurs, ou ID officiels des modèles pour les fiches associées par la documentation des fournisseurs.
  3. 3Examinez ensemble la position dans la source, la plage de scores, les votes, la licence et la configuration.
  4. 4Ouvrez Détails du modèle sur n’importe quelle ligne. Les correspondances officielles exactes utilisent le profil officiel ; toutes les autres lignes ouvrent un profil source qui préserve le nom et la configuration publiés.
  5. 5Ajoutez n’importe quelle ligne à la comparaison. Les associations exactes et sûres au niveau de la configuration utilisent la comparaison des versions officielles ; toutes les autres lignes utilisent la comparaison des enregistrements source au sein de la même source, dimension et instantané.

Comment interpréter le résultat

Un rang est relatif à une source et à un périmètre. Les ex æquo peuvent entraîner des sauts de numéros et les scores issus de différents angles de classement ne sont pas directement comparables.

Ce que cela ne peut prouver

OpenGPT organise les données publiques tierces et n’a pas réexécuté ces évaluations. Aucun classement ne désigne le meilleur modèle pour chaque utilisateur ou chaque tâche.

Question fréquente: Pourquoi certaines lignes n’affichent-elles qu’un ID ou un nom de modèle provenant de la source ?

Chaque ligne comporte désormais les détails du modèle et une action de comparaison. OpenGPT ajoute un ID de modèle officiel uniquement lorsque la documentation du fournisseur prouve la correspondance exacte ; dans le cas contraire, la comparaison des fiches sources conserve le nom de l’éditeur, la configuration et les données de classement, sans inventer de nouvel ID officiel.

Haut de page
02

Classements des agents d’IA

Choisissez un agent selon la tâche, la configuration complète, la qualité des preuves et les résultats comparables.

Ouvrir

À quoi sert cette fonctionnalité

Explorez 96 configurations publiées d’évaluation des Agents dans sept périmètres de tâches, ainsi que 109 résultats distincts de modèles BFCL pour l’appel d’outils, sans réduire des preuves incompatibles à un score unique.

Avant de commencer

Le résultat d’un agent appartient à une configuration complète : modèle de base, scaffold, outils, autorisations, budget, environnement, version du benchmark et date. OpenGPT conserve les champs déclarés par la source et laisse les champs manquants non renseignés au lieu de les considérer comme nuls.

Tutoriel pas à pas

  1. 1Choisissez la catégorie de tâches qui correspond à votre travail.
  2. 2Vérifiez le périmètre et la version du benchmark, la date d’évaluation, l’actualité des données et la note d’audit avant d’interpréter le classement.
  3. 3Utilisez la qualité des preuves pour distinguer les résultats reproduits ou contrôlés des exécutions publiques transparentes et des résultats déclarés par les fournisseurs.
  4. 4Ne comparez le taux de réussite, les preuves issues des répétitions, la durée et les interventions que si la source les publie dans les mêmes conditions. OpenGPT n’affiche le coût par réussite que lorsque le total publié et le dénominateur de tâches ou d’exécutions relèvent du même périmètre vérifié.
  5. 5Suivez les configurations utiles, consultez leur historique et sélectionnez deux à quatre entrées du même groupe comparable pour les afficher côte à côte.

Comment interpréter le résultat

Un rang décrit une configuration système complète dans le périmètre d’un benchmark. Interprétez-le avec le niveau de preuve, la fraîcheur, le nombre d’échantillons ou d’exécutions et les éventuels champs de coût et de fiabilité indiqués.

Ce que cela ne peut prouver

OpenGPT ne crée aucun score Agent universel. Sauf si un résultat est explicitement marqué comme reproduit, OpenGPT organise les preuves en amont au lieu de réexécuter l’évaluation ; aucun benchmark ne prouve qu’un produit est prêt pour tous les processus de production.

Question fréquente: Pourquoi un même agent ou modèle peut-il apparaître plusieurs fois ?

Un scaffold, une version de modèle, un ensemble d’outils, un niveau d’autorisation, un budget ou un paramètre de benchmark différent crée une configuration d’agent distincte qui doit rester un enregistrement séparé.

Haut de page
03

Soumettre un modèle ou un Agent

Envoyez une fiche publique d’identité ou de preuve pour examen sans modifier les classements.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez le processus de soumission lorsqu’un ID de modèle officiel ou un produit Agent est manquant, ou lorsqu’une source publique nécessite un examen éditorial.

Avant de commencer

Connectez-vous avec un compte vérifié et préparez une source HTTPS publique. Ne transmettez jamais d’identifiants, de fichiers privés ou d’informations personnelles.

Tutoriel pas à pas

  1. 1Choisissez Modèle ou Agent en haut du formulaire.
  2. 2Saisissez le nom public exact, le fournisseur ou l’organisation, ainsi que les champs d’identité demandés.
  3. 3Choisissez le type de source et fournissez un lien vers la documentation officielle, un dépôt public ou un résultat de benchmark public.
  4. 4Expliquez ce que l’examinateur doit vérifier, puis soumettez une seule fois.
  5. 5Suivez l’état d’examen dans vos soumissions récentes. Un produit Agent approuvé apparaît automatiquement dans l’annuaire des Agents consultable par recherche ; son classement reste distinct.

Comment interpréter le résultat

Une soumission réussie reçoit un numéro de référence et entre dans la file de vérification. Un produit Agent approuvé est un enregistrement de l’annuaire public, et non un rang dans le classement ni une recommandation d’OpenGPT.

Ce que cela ne peut prouver

Les soumissionnaires ne peuvent définir ni le rang, ni la qualité des preuves, ni la comparabilité, ni l’état de publication. Les contrôles des doublons et les limites de débit réduisent les abus, et une approbation ne modifie jamais automatiquement un classement.

Question fréquente: Pourquoi une soumission approuvée n’a-t-elle pas été ajoutée au classement ?

Les produits Agent approuvés peuvent être recherchés dans l’annuaire, mais leur classement nécessite toujours des preuves d’évaluation publiques comparables.

Haut de page
04

Nombre de versions : Modifications du classement et historique des

Suivez les évolutions entre des instantanés comparables et comparez les ID des modèles du catalogue.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez cette page pour connaître les évolutions depuis l’instantané précédent de la source, les nouvelles entrées, les différences entre versions exactes et la date de récupération des données.

Avant de commencer

L’évolution historique s’appuie actuellement sur le périmètre des préférences utilisateur de LMArena. Les autres sources actives restent limitées à leur état actuel tant qu’un instantané antérieur comparable n’est pas disponible.

Tutoriel pas à pas

  1. 1Vérifiez la date de la source, la référence de comparaison, la date de récupération et la règle de comparaison.
  2. 2Consultez les plus fortes progressions uniquement parmi les fiches présentes dans les deux instantanés.
  3. 3Considérez Première apparition comme une nouvelle entrée source, et non comme une date officielle de lancement.
  4. 4Filtrer le tableau des évolutions selon les catégories : hausse, baisse, inchangé, première apparition ou disparition du classement.
  5. 5Comparez deux ID de modèles du catalogue, puis téléchargez un instantané de la source lorsqu’une piste d’audit est nécessaire.

Comment interpréter le résultat

OpenGPT calcule les évolutions uniquement lorsque la source, le périmètre, l’unité et la méthode concordent, et conserve des instantanés mensuels téléchargeables.

Ce que cela ne peut prouver

Seules les dates de sortie documentées par le fournisseur sont reconnues comme sorties de produit. La comparaison des versions ne déduit ni la vitesse, ni le prix, ni la longueur du contexte, ni la qualité à partir des noms.

Question fréquente: Pourquoi LiveBench n’affiche-t-il aucun mouvement dans le classement ?

OpenGPT n’a pas figé d’édition antérieure comparable pour cette source active. Les sources suspendues restent historiques au lieu de contribuer à l’évolution actuelle.

Haut de page
05

Classements par tâche

Partez d’un scénario de travail réel et examinez trois versions officielles de modèles à tester en priorité.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez les classements par tâche pour transformer de vastes indicateurs publics en une petite présélection pratique pour le développement, la recherche, les documents, l’assistance, les travaux multilingues ou multimodaux, le coût, la confidentialité ou la vitesse.

Avant de commencer

Choisissez la tâche la plus proche de votre travail, puis notez vos prompts réels, vos données, vos outils, votre région, votre budget et vos exigences de confidentialité. Les preuves publiques affichées peuvent couvrir un périmètre plus large que votre tâche.

Tutoriel pas à pas

  1. 1Ouvrez le scénario de tâche le plus proche de la décision à prendre.
  2. 2Découvrez pourquoi ces trois versions officielles ont été sélectionnées et quelles incertitudes subsistent.
  3. 3Examinez, pour chaque candidat, la source publique, le rang ou la valeur dans la source, la date d’examen de la correspondance et la date limite des données.
  4. 4Sélectionnez deux ou trois candidats pour une comparaison côte à côte des données publiques.
  5. 5Ouvrez l’évaluation sur des tâches réelles avec les deux premiers candidats, modifiez l’ensemble de tâches d’exemple et testez les deux avec des paramètres comparables.

Comment interpréter le résultat

Vous obtenez trois candidats de départ officiels, les preuves publiques disponibles et des accès directs pour les comparer ou effectuer un test sur une tâche réelle.

Ce que cela ne peut prouver

Un classement par tâche est une première présélection, et non un classement universel ou une preuve du meilleur modèle. L’absence de preuve ne vaut pas zéro et des sources publiques différentes ne sont pas combinées en un seul score.

Question fréquente: Pourquoi un candidat de départ peut-il ne disposer d’aucun résultat public comparable ?

Une version officielle peut être pertinente pour la tâche en raison du positionnement du produit ou du type de déploiement, même lorsqu’aucun résultat de la version exacte n’est associé dans la source publique sélectionnée. L’absence de preuve reste visible et doit être résolue par votre propre test.

Haut de page
06

Radar de mise à niveau des modèles

Définissez les modèles que vous utilisez, vos travaux récurrents et vos priorités, puis examinez des indicateurs prudents pour déterminer quand une comparaison équitable est pertinente.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez Radar pour répondre à une question concrète : existe-t-il suffisamment de preuves publiques comparables pour tester une alternative au modèle que vous utilisez actuellement ?

Avant de commencer

Choisissez les versions officielles exactes, au moins une tâche récurrente et jusqu’à deux priorités. Utilisez le même navigateur et le même appareil, car la configuration reste locale.

Tutoriel pas à pas

  1. 1Choisissez les versions officielles exactes que vous utilisez actuellement ; les modèles enregistrés ne sont pas présumés actuels.
  2. 2Sélectionnez des tâches récurrentes et jusqu’à deux priorités, telles que la qualité, le coût, la vitesse, la confidentialité ou les contextes longs.
  3. 3Déterminez si chaque modèle mérite d’être comparé, peut continuer à être suivi sans risque ou approche de son retrait.
  4. 4Examinez les preuves publiques comparables, puis testez les deux modèles sur le même travail réel.
  5. 5Examinez les changements chaque semaine ou abonnez-vous au flux RSS public des changements de classement.

Comment interpréter le résultat

Radar crée un contrôle de mise à niveau local à l’appareil avec un modèle actuel, une alternative adaptée à la tâche lorsqu’elle existe, la date des preuves, les limites de l’incertitude et des actions de comparaison directe.

Ce que cela ne peut prouver

Une vérification de mise à niveau ne constitue pas une instruction de changer. Le coût, la vitesse, la confidentialité ou le contexte peuvent encore exiger des tests directs, et les paramètres locaux ne sont ni synchronisés ni sauvegardés.

Question fréquente: « À comparer » signifie-t-il que je dois remplacer mon modèle actuel ?

Non. Cela signifie qu’un indicateur comparable ou une modification du cycle de vie justifie un test sur la même tâche. Ne changez qu’après la réussite de l’alternative sur votre travail réel et selon vos contraintes.

Haut de page
07

Choisir un modèle d’IA

Transformez quatre exigences concrètes en une présélection explicable.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez l’outil de recherche lorsque vous savez quelle tâche accomplir, mais ignorez encore quelle série de modèles examiner en priorité.

Avant de commencer

Déterminez la tâche principale, l’endroit où le modèle peut s’exécuter, votre priorité d’exploitation principale et toute exigence linguistique.

Tutoriel pas à pas

  1. 1Choisissez la tâche la plus proche de votre travail réel.
  2. 2Définissez les limites du déploiement, en particulier lorsque les données ne peuvent pas quitter votre environnement.
  3. 3Choisissez la priorité sur laquelle vous êtes le moins disposé à faire des compromis.
  4. 4Définissez les besoins linguistiques, puis examinez pour chaque candidat les raisons de la correspondance, les risques et la prochaine étape de validation.
  5. 5Soumettez les meilleurs candidats à une évaluation sur des tâches réelles et testez les versions exactes des modèles sur les mêmes tâches.

Comment interpréter le résultat

Le libellé qualitatif et le nombre d’exigences satisfaites s’appliquent à la série de modèles, et non aux versions individuelles ; ni l’un ni l’autre ne constitue un score de benchmark. Vérifiez la disponibilité au déploiement de chaque version actuelle répertoriée et comparez les candidats sur les mêmes tâches.

Ce que cela ne peut prouver

L’outil de recherche ne fait appel à aucun modèle, ne vérifie pas les tarifs actuels et ne désigne pas de vainqueur universel. Une série de modèles peut comprendre des versions aux fonctionnalités différentes.

Question fréquente: Pourquoi un modèle renommé n’apparaît-il pas en tête ?

L’ordre reflète les contraintes que vous avez sélectionnées, et non la popularité générale. Modifiez une exigence pour identifier la cause du résultat, puis testez les versions exactes.

Haut de page
08

Annuaire et détails des modèles

Parcourez les ID de modèles documentés par les fournisseurs, ouvrez leurs pages détaillées et vérifiez si des données de classement publiques comparables existent.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez l’annuaire lorsque vous avez besoin d’un ID de modèle officiel exact, de la destination du fournisseur, des tâches adaptées et inadaptées, des sources et d’un état clair des données de classement.

Avant de commencer

Saisissez un nom de modèle, un fournisseur, un besoin de déploiement ou une tâche. Un ID de modèle documenté par le fournisseur ne garantit pas la disponibilité de données d’évaluation publiques comparables.

Tutoriel pas à pas

  1. 1Rechercher par modèle, version, fournisseur ou tâche.
  2. 2Filtrer par méthode de déploiement et par état : classé ou actuellement non classé.
  3. 3Ouvrez la page détaillée d’un modèle pour examiner son identité, l’usage prévu, la couverture des données publiques, les points forts, les limites, les sources et la date d’examen.
  4. 4Utilisez la destination officielle pour vérifier la disponibilité, les tarifs, la confidentialité et les limites actuels.
  5. 5Ajoutez deux à quatre versions du catalogue à la comparaison des données, puis soumettez deux finalistes à une évaluation sur tâche réelle.

Comment interpréter le résultat

« Classé » signifie que des données publiées comparables sont associées à l’ID exact du modèle. « Non classé » signifie que cette édition ne contient aucune fiche comparable appropriée ; il ne s’agit pas d’un score nul.

Ce que cela ne peut prouver

La documentation du fournisseur établit l’identité dans le catalogue, et non la disponibilité actuelle dans chaque pays ou niveau de service. La couverture des classements, les détails des modèles et les conditions des fournisseurs peuvent évoluer après la date d’examen.

Question fréquente: L’absence de classement signifie-t-elle que le modèle est faible ?

Non. Cela signifie que cette édition ne dispose pas de données publiques comparables adaptées à cet ID de modèle. Testez-le directement s’il reste pertinent pour votre décision.

Haut de page
09

Comparaison de données

Comparez deux à quatre versions officielles exactes ou des fiches provenant d’une même vue de classement publiée.

Ouvrir

À quoi sert cette fonctionnalité

La comparaison des versions officielles organise les ID documentés par les fournisseurs à partir des sources publiées. La comparaison des fiches sources conserve le nom et les paramètres de l’éditeur lorsqu’une comparaison officielle exacte entraînerait une perte d’informations.

Avant de commencer

Pour les versions officielles, choisissez deux à quatre ID du catalogue. Pour les fiches sources, choisissez deux à quatre lignes provenant de la même source, de la même dimension et du même instantané.

Tutoriel pas à pas

  1. 1Ajoutez n’importe quelle ligne d’un classement. Les associations sûres au niveau de la configuration utilisent la comparaison des versions officielles ; toutes les autres lignes utilisent la comparaison des enregistrements source.
  2. 2Les résultats officiels restent séparés par source et par dimension.
  3. 3Les résultats des fiches sources conservent le nom, les paramètres, le rang et le score publiés sur une échelle source commune.
  4. 4Les données manquantes restent inconnues au lieu d’être considérées comme nulles.
  5. 5Seules les versions officielles exactes peuvent passer à l’évaluation sur des tâches réelles après la sélection de deux finalistes.

Comment interpréter le résultat

La comparaison crée une présélection tenant compte des preuves et indique les informations manquantes. Elle ne produit pas de nouveau score de benchmark et ne désigne pas de vainqueur universel.

Ce que cela ne peut prouver

OpenGPT ne fait pas appel aux modèles dans cette vue. Les scores publiés provenant de sources ou de périmètres différents ne sont pas interchangeables, et les détails des modèles peuvent évoluer après leur date d’examen.

Question fréquente: Quelle est la différence entre la comparaison de données et l’évaluation sur des tâches réelles ?

La comparaison de données synthétise les informations déjà publiées pour deux à quatre modèles. L’évaluation sur des tâches réelles porte sur exactement deux versions, vous demande d’exécuter les mêmes prompts dans les deux services et examine les réponses collées en masquant les libellés visibles des modèles.

Haut de page
10

Mes modèles

Conservez dans ce navigateur une courte liste de travail d’entrées de classement.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez Mes modèles pour revenir rapidement aux candidats, ouvrir des destinations fiables et ajouter à une comparaison les ID de modèles pris en charge.

Avant de commencer

Utilisez le même navigateur et le même appareil. La liste est stockée localement, sans compte OpenGPT ni synchronisation dans le cloud.

Tutoriel pas à pas

  1. 1Sélectionnez Enregistrer sur n’importe quelle ligne du classement.
  2. 2Ouvrez Modèles enregistrés dans la barre de navigation supérieure pour consulter les entrées enregistrées.
  3. 3Chaque fiche enregistrée affiche l’ID de modèle ou le nom indiqué par la source. Les fiches dotées d’un ID de modèle officiel peuvent également ouvrir la destination du fournisseur ou accéder à la comparaison.
  4. 4Ajoutez deux ID de modèles compatibles distincts, puis ouvrez la comparaison des données publiques. Choisissez-y deux finalistes avant de lancer une évaluation sur tâche réelle.
  5. 5Supprimez les entrées dont vous n’avez plus besoin. L’actualisation ou le changement de langue du site conserve la liste dans le même navigateur.

Comment interpréter le résultat

Le nombre affiché à côté de Mes modèles indique combien d’entrées sont enregistrées. L’identité source et l’identité officielle du modèle restent distinctes.

Ce que cela ne peut prouver

Cette liste n’est ni un compte, ni une synchronisation de favoris, ni une sauvegarde. Aucun autre navigateur ou appareil ne la verra ; la navigation privée, les restrictions de stockage ou l’effacement des données du site peuvent la supprimer.

Question fréquente: Pourquoi mes modèles enregistrés ont-ils disparu ?

Vérifiez que vous utilisez le même profil de navigateur et le même appareil. Si le stockage du site a été effacé ou bloqué, OpenGPT ne peut pas restaurer la liste locale.

Haut de page
11

Proof Lab

Effectuez un essai privé sur des tâches réelles ; le mode temporaire conserve les résultats bruts en mémoire, sauf si vous décidez de les enregistrer sur cet appareil.

Ouvrir

À quoi sert cette fonctionnalité

Comparez 2 à 4 configurations exactes de Modèle ou d’Agent à l’aide d’un jeu de tâches unique, contrôlé et auditable.

Avant de commencer

Consignez chaque configuration exacte, ouvrez les services concernés du fournisseur, retirez les données sensibles et gardez à l’esprit que les politiques du fournisseur s’appliquent à tout ce que vous lui transmettez.

Tutoriel pas à pas

  1. 1Choisissez 2 à 4 configurations exactes de Modèle ou d’Agent ; ne considérez pas un nom de famille comme une configuration reproductible.
  2. 2Chargez un modèle ou créez un jeu de tâches modifiable, puis figez-le avant de recueillir les résultats.
  3. 3Exécutez vous-même chaque tâche figée dans chaque configuration et collez chaque résultat complet dans la matrice.
  4. 4Utilisez un examen équilibré et en aveugle de toutes les paires. Consignez Réussite, Échec, Non concluant ou Non testé, ainsi que les échecs critiques ; conservez la latence et le coût comme observations distinctes et ne créez aucun score global synthétique.
  5. 5Examinez les preuves révélées et confirmez explicitement l’issue de la décision. Exportez les métadonnées par défaut ; n’incluez l’intégralité des résultats bruts qu’après consentement, puis vérifiez localement le paquet exporté.

Comment interpréter le résultat

Le résultat est une issue confirmée par l’utilisateur, liée au jeu de tâches figé et aux configurations consignées. L’exportation des seules métadonnées est l’option par défaut ; l’exportation complète des données brutes exige un consentement explicite et peut être contrôlée par le vérificateur local.

Ce que cela ne peut prouver

Le masquage des libellés réduit le biais lié à la visibilité des noms, mais ne constitue pas un double aveugle. OpenGPT n’exécute pas les services des fournisseurs et ne prouve ni l’origine des résultats, ni l’exactitude de la configuration, ni l’exhaustivité, ni la confidentialité chez les fournisseurs externes, ni la généralisation au-delà de ces tâches. Les résultats des essais privés sont « Testés sur votre travail », pas des preuves publiques.

Question fréquente: Proof Lab téléverse-t-il les prompts ou les résultats bruts ?

L’essai s’exécute dans votre navigateur. Le mode temporaire conserve les résultats bruts en mémoire ; leur conservation sur cet appareil est facultative. L’exportation des métadonnées exclut les résultats bruts, et leur exportation complète exige un consentement explicite.

Haut de page
12

Ensembles de tâches enregistrés et réévaluation

Réutilisez les mêmes prompts réels dans une évaluation ultérieure des modèles sans reconstruire l’ensemble de tâches.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez les ensembles de tâches enregistrés afin de rendre les futures comparaisons plus cohérentes et de réévaluer les versions exactes des modèles après une nouvelle version ou un changement des données publiques.

Avant de commencer

Complétez les titres et les prompts des tâches, choisissez un nom clair pour l’ensemble de tâches et utilisez le même navigateur et le même appareil. Un ensemble de tâches peut contenir du texte sensible ; retirez donc les données privées avant de l’enregistrer.

Tutoriel pas à pas

  1. 1Dans l’évaluation sur des tâches réelles, préparez ou modifiez un ensemble de tâches représentatif de votre travail.
  2. 2Donnez un nom reconnaissable à l’ensemble de tâches et enregistrez-le.
  3. 3Choisissez ultérieurement l’ensemble de tâches enregistré et chargez-le dans l’évaluation en cours.
  4. 4Sélectionnez deux versions exactes de modèles et exécutez chaque prompt avec des paramètres comparables.
  5. 5À partir d’un résultat terminé, choisissez Réévaluer pour conserver les tâches et les versions des modèles tout en effaçant les anciennes réponses, les jugements et le rapport précédent.

Comment interpréter le résultat

Le nom, le modèle, la langue, les titres et les prompts de l’ensemble de tâches sont stockés localement pour être réutilisés. La réévaluation démarre une nouvelle exécution tout en conservant les entrées de test prévues.

Ce que cela ne peut prouver

Les ensembles de tâches enregistrés n’existent que sur cet appareil : ils ne sont ni synchronisés ni sauvegardés ailleurs. Les réponses, choix de modèles, examens, rapports et clés API ne sont pas enregistrés dans un ensemble de tâches. L’effacement des données du site peut supprimer tous les ensembles enregistrés.

Question fréquente: Qu’est-ce qui change lorsque je choisis « Réévaluer » ?

OpenGPT conserve les mêmes tâches et les versions exactes des modèles, puis efface les réponses, les scores, les jugements, l’état d’affichage et le rapport précédents afin que la prochaine exécution soit indépendante de l’ancien résultat.

Haut de page
13

Rapport décisionnel partageable

Créez un lien respectueux de la confidentialité pour une sélection de modèles officiels et sa date limite de données publiques.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez le rapport pour communiquer la tâche et les versions officielles exactes envisagées, les preuves publiques disponibles et un candidat sélectionné facultatif.

Avant de commencer

Créez le rapport à partir d’un classement par tâche. Confirmez la tâche, les ID exacts des modèles, la date limite des données et le choix facultatif avant le partage.

Tutoriel pas à pas

  1. 1Ouvrez un classement par tâche et créez un rapport à partir de deux ou trois candidats officiels.
  2. 2Vous pouvez désigner un modèle comme sélectionné ; laisser ce choix vide est autorisé.
  3. 3Examinez la couverture des données publiques et le périmètre du rapport.
  4. 4Copiez le lien, utilisez la feuille de partage de l’appareil, imprimez-le ou téléchargez la fiche JSON assainie.
  5. 5Un destinataire peut ouvrir la même présélection, comparer les données publiques ou lancer une évaluation sur tâche réelle.

Comment interpréter le résultat

L’URL partagée contient uniquement l’ID de la tâche, les ID officiels exacts des modèles, la date limite des données publiques et le modèle sélectionné facultatif, afin que le destinataire puisse examiner la même présélection.

Ce que cela ne peut prouver

Le rapport partageable ne contient aucun prompt, réponse de modèle, note, clé API ou rapport d’évaluation complet. Il s’agit d’une fiche de présélection, et non de la preuve d’un vainqueur universel ou d’un résultat de fournisseur authentifié.

Question fréquente: Quelqu’un peut-il voir le contenu de mon évaluation depuis le lien de partage ?

Non. Les prompts, réponses, notes, clés API et le projet d’évaluation local sont exclus. Inspectez toujours le lien avant de le partager si vous avez ajouté des informations en dehors du processus de rapport pris en charge.

Haut de page
14

Vérification du rapport

Vérifiez la structure et la cohérence interne des rapports JSON pris en charge, recherchez les motifs de secrets et générez une empreinte locale.

Ouvrir

À quoi sert cette fonctionnalité

Utilisez le vérificateur pour examiner un paquet OpenGPT Evidence v1 ou v2, ou un rapport V3 téléchargé depuis l’Espace décisionnel. Chaque contrôle s’exécute localement dans ce navigateur.

Avant de commencer

Obtenez le fichier JSON d’origine. Pour un rapport de comparaison, téléchargez-le depuis l’Espace décisionnel ; terminez d’abord chaque cas si vous avez besoin d’un résultat achevé plutôt que d’un brouillon.

Tutoriel pas à pas

  1. 1Choisissez le fichier JSON ; il restera dans ce navigateur.
  2. 2Vérifiez que le vérificateur reconnaît Evidence v1/v2, la comparaison privée OpenGPT v1/v2 ou l’Espace décisionnel v3.
  3. 3Pour les paquets de preuves, vérifiez les champs obligatoires, les exécutions, les horodatages, les scores et les contrôles de sécurité relatifs aux secrets. Pour les rapports de comparaison, vérifiez le nom des candidats, la suite de tâches, l’état de brouillon ou d’achèvement, l’unicité des cas et la concordance entre la synthèse et les verdicts consignés.
  4. 4Lisez la synthèse déclarée et enregistrez l’empreinte SHA-256 si vous devez confirmer ultérieurement que le fichier examiné est strictement identique.
  5. 5Si un contrôle échoue, corrigez les données sources ou terminez les cas de comparaison manquants au lieu de modifier le rapport téléchargé pour forcer sa validation.

Comment interpréter le résultat

Pour Evidence v1/v2, « Réussi » signifie que le paquet respecte les règles prises en charge en matière de structure et de cohérence, tandis que « Démonstration » signale un exemple. Pour un rapport de comparaison, « Réussi » signifie qu’un rapport terminé est cohérent en interne ; « Brouillon » signifie que sa structure est valide mais que la comparaison est inachevée. « Échec » signifie qu’au moins un contrôle obligatoire doit être examiné.

Ce que cela ne peut prouver

Une validation ne prouve ni que le modèle désigné a produit les réponses collées, ni que les affirmations du fournisseur sont exactes, ni que le résultat se généralise au-delà des tests enregistrés. Les résultats de fichiers sans rapport ne sont pas automatiquement comparables.

Question fréquente: La validation d’un rapport de comparaison prouve-t-elle qu’un modèle est meilleur ?

Non. Cela confirme uniquement que le rapport pris en charge est structurellement valide et cohérent en interne. Vous devez encore juger l’identité du modèle, la qualité du test, les résultats et la pertinence de la décision.

Haut de page
15

Méthodologie d’évaluation

Découvrez ce qui rend une décision sur un modèle vérifiable et reproductible.

Ouvrir

À quoi sert cette fonctionnalité

Consultez cette page avant de concevoir, de publier ou d’utiliser une évaluation. Elle distingue la qualité des preuves de la popularité des modèles.

Avant de commencer

Commencez par une question de décision concrète, des versions de modèles nommées, des tâches représentatives et un plan de conservation des résultats bruts.

Tutoriel pas à pas

  1. 1Définissez la décision et les critères de réussite avant de voir les résultats.
  2. 2Utilisez le même ensemble de tâches, les mêmes paramètres et les mêmes règles de notation pour chaque candidat.
  3. 3Conserver les prompts, résultats, paramètres, échecs, horodatages et empreintes de la suite.
  4. 4Indiquez les opérations effectuées manuellement ou automatiquement, examinées sans afficher les libellés des modèles, randomisées ou reproduites indépendamment.
  5. 5Publiez les conclusions avec leur degré d’incertitude et leurs limites explicites.

Comment interpréter le résultat

Evidence v1/v2 vérifie principalement le format et les déclarations. L’Espace décisionnel V3 prend en charge le recalcul local (L3) ; la reproduction indépendante L4 reste non prise en charge.

Ce que cela ne peut prouver

Un processus rigoureux peut réduire les biais, mais ne peut garantir qu’un échantillon représente chaque utilisateur, chaque langue, les versions futures ou les conditions de production.

Question fréquente: Un niveau de preuve plus élevé est-il toujours nécessaire ?

Adaptez la rigueur aux conséquences. Un essai personnel peut se contenter de L1 ; une affirmation publique ou à forts enjeux doit rechercher des preuves indépendantes plus solides.

Haut de page

Glossaire en langage clair

Utilisez ces définitions lorsqu’un libellé ne vous est pas familier.

Fiche source
Une ligne conservée depuis un classement publié, avec l’ID ou le nom du modèle source maintenu à l’identique pour vérification et audit.
ID officiel du modèle
Un identifiant de modèle documenté par le fournisseur qu’OpenGPT conserve séparément du nom de l’enregistrement source.
Version du catalogue
Une version de modèle issue de la documentation du fournisseur, avec sa destination officielle et sa source de vérification.
Fourchette de scores probable
Un intervalle d’incertitude publié autour du score affiché. Des intervalles plus larges signifient une précision moindre ; les intervalles de différentes sources de classement ne sont pas directement comparables.
Mes modèles
Une présélection stockée uniquement dans ce navigateur. Il ne s’agit ni d’un compte, ni d’une synchronisation cloud, ni d’un favori du fournisseur.
Adéquation aux exigences
Une étiquette qualitative d’adéquation de la famille accompagnée du nombre d’exigences satisfaites ; aucun de ces éléments n’évalue les versions individuelles. Vérifiez la disponibilité et comparez les versions exactes sur les mêmes tâches.
Famille de modèles
Un ensemble de versions de modèles apparentées. Les capacités, les prix et l’accès peuvent varier d’une version à l’autre.
Évaluation comparative
Un ensemble de tâches reproductibles et une règle de notation permettant de comparer des systèmes dans les conditions indiquées.
Configuration de l’Agent
Le modèle de base, l’échafaudage, les outils, les autorisations, le budget, l’environnement, la version du benchmark et la date ayant produit un résultat Agent.
Qualité des preuves
Une étiquette décrivant la manière dont un résultat a été produit ou vérifié. Elle ne modifie pas le score source.
Coût par réussite
Coût d’évaluation déclaré divisé par le nombre de tâches réussies. Il n’est affiché que lorsque des données sources comparables existent ; un coût manquant n’équivaut pas à zéro.
Fichier de preuves
Un enregistrement structuré qui précise comment une évaluation a été menée et ce qu’elle a observé.
Schéma
Les règles lisibles par machine qui définissent les champs obligatoires et les valeurs autorisées dans un fichier.
Empreinte SHA-256
Un identifiant local des octets exacts d’un fichier ; toute modification du fichier change son empreinte.

Dépannage

Aucun modèle ne satisfait toutes les exigences

Examinez l’exigence qui a exclu chaque candidat, puis n’assouplissez qu’une contrainte réellement flexible.

Examiner les exigences

Un numéro de rang de la source est omis

L’éditeur peut utiliser des rangs ex æquo ou plusieurs configurations. OpenGPT conserve la position d’origine au lieu de renuméroter les lignes visibles.

Examiner le classement

Il manque le coût ou la fiabilité d’un résultat d’Agent

La source n’a publié aucune valeur comparable. OpenGPT la laisse non déclarée au lieu de l’assimiler à zéro ; comparez uniquement des valeurs relevant du même périmètre de benchmark.

Examiner les preuves relatives aux Agents

Une ligne ne comporte aucun ID officiel de modèle

Il s’agit d’une fiche source complète, pas d’un état non résolu. Ouvrez la source d’origine ; utilisez l’annuaire des modèles lorsque vous avez besoin d’une identité documentée par le fournisseur et d’un accès officiel.

Examiner l’identité de la source

La section Mes modèles est vide ou a disparu

Utilisez le même profil de navigateur et le même appareil. Le mode privé, le blocage du stockage ou l’effacement des données du site peuvent supprimer la liste locale.

Ouvrir Mes modèles

Impossible d’ajouter un enregistrement à la comparaison des données

La comparaison de données accepte les ID de modèles du catalogue. Le même modèle est peut-être déjà sélectionné ou la liste a peut-être atteint sa limite de quatre modèles. Choisissez une autre version du catalogue ou retirez d’abord un candidat.

Ouvrir l’annuaire des modèles

L’essai Proof Lab est incomplet

Revenez à l’essai et renseignez, pour chaque paire configuration-tâche obligatoire, le résultat, l’état d’examen, le contrôle des échecs critiques et l’issue confirmée par l’utilisateur.

Continuer dans Proof Lab

Un brouillon local est en conflit ou doit être réinitialisé

Revenez à Comparer, examinez l’avertissement relatif au brouillon local plus récent, puis choisissez délibérément de conserver ou de réinitialiser le brouillon.

Examiner le brouillon local

Un fichier de preuve échoue

Utilisez l’élément en échec de la liste de contrôle pour corriger la fiche source. N’insérez aucun secret et ne réécrivez pas les résultats.

Ouvrir le vérificateur
contact@opengpt.com

Encore besoin d’aide ?

Signalez un lien rompu, un détail de modèle incorrect ou un problème que vous n’avez pas pu résoudre.

Assistance par e-mail