MÉTHODOLOGIE DE L’ESPACE DÉCISIONNEL D’IA

Découvrez comment une recommandation devient une décision.

OpenGPT est un espace décisionnel d’IA. Il maintient distincts la mise en correspondance éditoriale des exigences, les fiches sources factuelles, l’évaluation sur des tâches réelles et les preuves publiées issues des benchmarks, afin que chaque résultat puisse présenter ses conditions et ses limites.

La méthode en une minute

  • Un rang est relatif à une source et à un périmètre précis, et non à un score universel.
  • Les unités de comparaison sont les versions exactes des modèles et les configurations complètes des Agents.
  • Les données inconnues ou incompatibles restent inconnues au lieu de devenir zéro ou un classement combiné.
  • Les contrôles locaux des rapports prouvent leur structure et leur cohérence interne, pas l’origine des résultats ni l’authenticité du fournisseur.

Scores d’adéquation éditoriale · editorial-fit-v1

Comment sont attribués les scores éditoriaux d’adéquation de 0 à 10

Ces huit indicateurs du catalogue permettent une comparaison catégorie par catégorie. Ils constituent une couche documentée d’appréciation éditoriale d’OpenGPT, distincte des points de recommandation rules-v2 et des preuves issues de benchmarks publics.

Score éditorial d’adéquation produit : 10 indique une meilleure adéquation à la dimension nommée ; toutes les dimensions sont affichées à égalité et ne sont jamais combinées pour désigner un vainqueur global.

Intelligence

0–10

Adéquation éditoriale aux travaux généraux, vastes et complexes, fondée sur les fonctionnalités documentées, le rôle dans le catalogue et les contraintes connues du produit ; il ne s’agit ni d’un QI ni d’un score de benchmark.

Développement

0–10

Adéquation éditoriale à la planification logicielle, à la mise en œuvre, au débogage, à la revue et aux processus de dépôt ; il ne s’agit pas d’un taux de réussite mesuré.

Raisonnement

0–10

Adéquation éditoriale à l’analyse en plusieurs étapes, à la gestion des contraintes et à la résolution structurée de problèmes ; il ne s’agit pas de la reproduction d’un benchmark de raisonnement.

Rédaction

0–10

Adéquation éditoriale aux processus de rédaction, de révision, de production de contenus longs et de documentation ; il ne s’agit pas d’un résultat mesuré portant sur le style ou l’exactitude factuelle.

Vitesse

0–10

Adéquation éditoriale à l’itération réactive, fondée sur le positionnement du produit et son mode de mise à disposition ; il ne s’agit pas d’une mesure de latence.

Rapport coût-efficacité

0–10

Adéquation éditoriale à la maîtrise des prix d’accès et des coûts d’exploitation, fondée sur les niveaux répertoriés et le mode de déploiement ; il ne s’agit ni d’un calcul du coût total ni d’une garantie de prix.

Contrôle de la confidentialité

0–10

Adéquation éditoriale au contrôle du déploiement et des données, fondée sur une classification locale, hybride ou cloud ; il ne s’agit pas d’un audit de sécurité, de conformité ou de télémétrie.

Écosystème

0–10

Adéquation éditoriale aux outils, intégrations, plateformes et options de déploiement disponibles ; il ne s’agit ni d’une mesure de part de marché ni d’une mesure de la qualité des intégrations.

Pondérations et agrégation

Chaque dimension bénéficie de la même importance visuelle. Il n’existe aucune pondération arithmétique, moyenne, note totale ou vainqueur global ; l’utilisateur détermine quelles dimensions importent dans les conditions indiquées.

Limite du jugement éditorial humain

Les éditeurs attribuent des indicateurs entiers d’adéquation de 0 à 10 à partir du barème, des informations produit confirmées par les fournisseurs et des classifications du catalogue. Un score ne constitue ni une mesure d’une version exacte, ni un résultat de benchmark, ni une probabilité, ni une garantie du fournisseur.

Sources

Les pages officielles des fournisseurs étayent l’identité, l’accès, les fonctionnalités publiées, les options de déploiement et les tarifs affichés. Les libellés « idéal pour », les points forts, les faiblesses, les classifications et toutes les valeurs de 0 à 10 d’OpenGPT sont des données éditoriales.

Examen du catalogue

Dernier examen du catalogue:

Confiance: Couverture éditoriale moyenne

La confiance décrit l’exhaustivité de la couverture du catalogue et de l’explication, et non la probabilité de performances élevées. Les informations des fournisseurs peuvent évoluer et l’indicateur d’adéquation n’a pas été mesuré de façon indépendante.

Applicabilité

Utilisez les scores pour comparer les entrées du catalogue selon la dimension indiquée et les hypothèses actuelles sur le produit et le déploiement. Ne considérez pas les écarts de score comme des différences de performance mesurées.

Avant l’adoption, vérifiez les informations actuelles du fournisseur et testez la version exacte du modèle, le niveau de service, les outils, la région et un échantillon représentatif du travail.

Méthode publiée · rules-v2

Comment OpenGPT produit ses recommandations

Le Configurateur transforme un profil local en présélection déterministe. Les points ci-dessous classent l’adéquation éditoriale des produits après application de critères éliminatoires de budget et de confidentialité ; ils ne mesurent pas la qualité des modèles.

Dimensions de notation et points additifs prévus par les règles

Les points sont des pondérations conditionnelles, et non des pourcentages. Un critère éliminatoire écarte tout élément inadmissible avant la notation.

Adéquation à la tâche et à l’objectif

Model · Tool

Les modèles obtiennent +12 pour chaque tâche sélectionnée correspondante et +10 pour une correspondance exacte de l’objectif. Les outils obtiennent +10 pour chaque cas d’usage sélectionné correspondant.

User-declared conditions · OpenGPT editorial catalog

Confidentialité et déploiement

Model · Tool

Une confidentialité élevée exclut les modèles non locaux et les outils non classés comme hautement confidentiels. Les modèles locaux admissibles obtiennent +30 et les outils à confidentialité élevée +12. Pour une confidentialité moyenne, les modèles hybrides, locaux et cloud obtiennent respectivement +8, +5 et +2.

User-declared conditions · OpenGPT editorial catalog

Admissibilité budgétaire

Model · Tool

Les éléments qui se situent en dehors de la tranche de prix indiquée sont exclus. Les modèles admissibles obtiennent +12 et les outils +8 ; un modèle de profil gratuit doté d’un accès gratuit répertorié obtient +16 supplémentaires.

User-declared conditions · Provider-published facts · OpenGPT editorial catalog

Adéquation au rôle professionnel

Model · Tool

Les correspondances entre étudiants et modèles reçoivent +10 ; les autres correspondances prises en charge entre modèles et rôles, +8. Les correspondances entre étudiants et outils reçoivent +8 ; les autres correspondances prises en charge entre outils et rôles, +6.

User-declared conditions · OpenGPT editorial catalog

Indicateurs sectoriels

Model · Tool

Les termes sectoriels reconnus sont associés à des catégories de tâches. Les modèles reçoivent +5 et les outils +4 pour chaque correspondance avec une tâche associée. Le texte libre lui-même n’est pas copié dans le processus.

User-declared conditions · OpenGPT editorial catalog

Adéquation linguistique

Modèle

Pour une préférence autre que l’anglais, une correspondance multilingue dans le catalogue obtient +14 et une absence de correspondance −3. Pour l’anglais, l’adéquation à la rédaction ou à la documentation obtient +3.

User-declared conditions · OpenGPT editorial catalog

Adéquation à la plateforme

Model · Tool

La correspondance du modèle obtient +3 pour le web, +10 pour l’ordinateur, +8 pour le terminal, +7 pour l’API et +9 pour le mobile. Les outils obtiennent +7 par plateforme correspondante ou −3 lorsqu’aucune ne correspond.

User-declared conditions · OpenGPT editorial catalog

Adéquation au niveau d’expérience

Model · Tool

L’adéquation du modèle vaut +10 pour les débutants (ou −4 en cas d’inadéquation avec un modèle local), +7 pour les utilisateurs avancés et +2 pour les utilisateurs intermédiaires avec un modèle de pointe ou hybride. L’adéquation des outils vaut respectivement +6 et +5 pour les débutants et les utilisateurs avancés.

User-declared conditions · OpenGPT editorial catalog

Sélection et ex æquo

Model · Tool

Les candidats admissibles sont triés selon les points des règles ; les ex æquo sont départagés par ordre alphabétique. Les rôles sont attribués dans un ordre fixe et jusqu’à trois autres modèles correspondants deviennent des alternatives.

Règles déterministes v2

Sources et limites des affirmations

Source factuelle

Informations publiées par le fournisseur

Les pages officielles des fournisseurs étayent l’identité, l’accès, les descriptions des fonctionnalités publiées et les tarifs affichés. OpenGPT ne considère pas ces pages comme des tests de performance indépendants.

Jugement éditorial

Catalogue éditorial OpenGPT

Les libellés « idéal pour », les points forts, les classifications de confidentialité et de déploiement ainsi que les indicateurs d’adéquation produit sont des appréciations éditoriales. Il ne s’agit ni de mesures de benchmark ni de garanties des fournisseurs.

Condition déclarée par l’utilisateur

Conditions déclarées par l’utilisateur

L’objectif, les tâches, le rôle, le budget, la confidentialité, la langue, la plateforme, les compétences et les indicateurs sectoriels proviennent du profil local de l’utilisateur. Ils décrivent l’applicabilité, pas des preuves externes.

Règle mécanique

Règles déterministes v2

Le même profil normalisé et le même instantané du catalogue produisent le même ordre. L’arithmétique peut être expliquée, mais le déterminisme ne transforme pas les données éditoriales en faits.

Contexte uniquement

Contexte des benchmarks publics

Les classements publics restent des preuves distinctes. rules-v2 n’ajoute ni rang ni score de benchmark aux points de recommandation ; utilisez-les après la présélection et conservez le périmètre propre à chaque source.

Faits et jugement éditorial

Source factuelle

Les affirmations factuelles doivent renvoyer à une source nommée du fournisseur ou du benchmark, à une identité exacte lorsqu’elle est disponible et à une date d’examen.

Jugement éditorial

Les libellés d’adéquation, points forts, classifications, hypothèses, niveaux de confiance et recommandations sont des appréciations éditoriales d’OpenGPT. Ils ne doivent pas être présentés comme des résultats mesurés pour une version exacte.

Fréquence d’examen et niveau de confiance

La méthodologie et les fiches de recommandation actives font l’objet d’un examen planifié au moins tous les 90 jours, ainsi que d’examens déclenchés par des événements. Chaque résultat doit utiliser la date d’examen de sa fiche, pas celle de cette page.

L’examen est déclenché lorsque

  • Un fournisseur modifie l’ID, le cycle de vie, le chemin d’accès, une déclaration de capacité ou le prix affiché d’un modèle.
  • Le moteur de recommandation, les pondérations, les critères éliminatoires ou la taxonomie éditoriale changent.
  • Une correction signale une erreur importante concernant la source, l’identité, le tarif, la confidentialité ou l’applicabilité.

Règles de confiance

La confiance décrit l’exhaustivité de l’explication de l’adéquation et de la fiche qui l’étaye. Elle n’exprime pas la probabilité que le modèle soit performant.

Élevé
L’identité exacte et une source factuelle actuelle sont présentes ; les champs importants sont résolus, les hypothèses sont visibles et une alternative qualifiée est nommée.
Moyen
La correspondance peut être expliquée, mais une source, une condition ou un fait actuel doit être confirmé avant toute adoption.
Faible
L’identité, l’actualité, les tarifs, la confidentialité ou l’applicabilité présentent une lacune importante. Considérez cet élément uniquement comme un candidat à étudier.

Applicabilité et conditions

  • S’applique à la présélection éditoriale rules-v2 générée à partir du catalogue actuel et vérifié des modèles et outils.
  • Le résultat dépend du profil soumis et de l’instantané du catalogue ; la modification de l’un ou l’autre peut modifier le résultat.
  • Il s’agit d’une aide à la décision à faibles enjeux, et non d’une preuve de qualité, du prix en temps réel, d’une position dominante dans un benchmark, de sécurité, de légalité ou d’aptitude à un usage réglementé.

Affichage d’audit obligatoire pour chaque résultat

Une recommandation intégrée doit présenter les sept champs ci-dessous sans obliger l’utilisateur à déduire la limite des preuves.

  1. Pourquoi
  2. Preuves
  3. Hypothèses
  4. Dernier examen
  5. Confiance
  6. Meilleure alternative
  7. Quand ne pas choisir cette option

D’une tâche réelle à une conclusion vérifiable

1

Définir le test

Avant toute comparaison, consignez la tâche, les critères de réussite, les entrées, les contraintes, les versions exactes des modèles, les paramètres et la date.

2

Utiliser les mêmes conditions

Soumettez la même tâche et le même barème à chaque candidat. Les libellés masqués réduisent le biais lié à la visibilité des noms, mais il ne s’agit ni d’un test en double aveugle ni d’un test exécuté indépendamment.

3

Conserver les données sources

Enregistrez les prompts, les réponses, les scores, les erreurs, la latence et les hachages. Ne remplacez pas les preuves manquantes par des estimations.

4

Énoncer les limites

Affichez l’incertitude, la taille de l’échantillon, les exclusions, les contradictions et ce que le résultat ne prouve pas.

Niveaux de preuve

Evidence v1/v2 vérifie le format du fichier et la cohérence déclarée. L’Espace décisionnel V3 recalcule également les hachages, attributions, correspondances, scores et synthèses à partir des entrées enregistrées. Cela ne prouve pas une reproduction indépendante de niveau L4.

L1Supported now

Format vérifié

Le fichier respecte le schéma déclaré et ne contient aucun champ secret évident.

L2Partially supported

Fiche complète

La cible est une fiche cohérente des tâches, des paramètres, des déclarations de modèles et de la date d’évaluation. V1 ne vérifie qu’une partie de cette fiche.

L3Supported for V3

Recalculable

L’Espace décisionnel V3 inclut les résultats bruts collés et les données de notation afin d’assurer un recalcul local strict ; Evidence v1/v2 ne comporte pas les mêmes champs.

L4Not yet supported

Reproduit indépendamment

Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.

Comment comparer les classements d’agents d’IA

Chaque ligne représente une configuration d’agent publiée dans le périmètre d’un benchmark nommé. Il ne s’agit pas d’un score du seul modèle de base.

Comparer les configurations système

Conservez ensemble tous les champs publiés par la source concernant l’agent, le modèle de base, l’échafaudage, l’outil, l’environnement, le budget et la date ; marquez les champs non publiés comme inconnus.

Conserver les échelles d’origine

Classez uniquement au sein d’un même benchmark, d’une même version, des mêmes règles de tâches et d’un groupe d’exécutions comparable. OpenGPT ne crée aucun score universel couvrant plusieurs benchmarks.

Indiquez l’état des preuves

Distinguez les fiches répertoriées par l’éditeur d’un benchmark, les contributions contrôlées en amont, les rapports des fournisseurs et les exécutions de la communauté.

Conserver les preuves opérationnelles

Affichez le coût, la latence, les étapes et les interventions humaines lorsque la source fournit des valeurs comparables ; laissez les valeurs manquantes comme inconnues.

Ce que la validation locale peut établir

  • Champs obligatoires et types de données pris en charge
  • Cohérence interne des scores, des exécutions, des dates et des hachages
  • Si le paquet indique qu’il contient des données de démonstration
  • Absence de champs courants de clés d’API et de secrets

Ce que cela ne peut établir à lui seul

  • Que le fournisseur ou le modèle déclaré a réellement produit le résultat
  • Qu’un score est exempt de biais de sélection ou d’une conception de test insuffisante
  • Qu’un résultat s’applique à chaque tâche, langue, utilisateur ou future version de modèle
  • Qu’un modèle est sûr, légal ou adapté à une décision à fort enjeu

Principes de publication

Aucun paiement pour être classé

Un parrainage peut être déclaré, mais il ne peut modifier ni la notation, ni les critères de preuve, ni le positionnement.

Les versions, pas les marques

Une série de modèles n’est pas un objet de test stable. Les ID exacts des modèles, les paramètres, la région et la date sont déterminants.

Des tâches réelles avant toute généralisation

OpenGPT recommande des sélections selon les exigences, puis demande aux utilisateurs de tester leur propre travail représentatif.

L’incertitude est un résultat

Les ex æquo, les petits échantillons, les exécutions en échec et les preuves non concluantes doivent rester visibles.