Découvrez comment une recommandation devient une décision.
OpenGPT est un espace décisionnel d’IA. Il maintient distincts la mise en correspondance éditoriale des exigences, les fiches sources factuelles, l’évaluation sur des tâches réelles et les preuves publiées issues des benchmarks, afin que chaque résultat puisse présenter ses conditions et ses limites.
La méthode en une minute
- Un rang est relatif à une source et à un périmètre précis, et non à un score universel.
- Les unités de comparaison sont les versions exactes des modèles et les configurations complètes des Agents.
- Les données inconnues ou incompatibles restent inconnues au lieu de devenir zéro ou un classement combiné.
- Les contrôles locaux des rapports prouvent leur structure et leur cohérence interne, pas l’origine des résultats ni l’authenticité du fournisseur.
Scores d’adéquation éditoriale · editorial-fit-v1
Comment sont attribués les scores éditoriaux d’adéquation de 0 à 10
Ces huit indicateurs du catalogue permettent une comparaison catégorie par catégorie. Ils constituent une couche documentée d’appréciation éditoriale d’OpenGPT, distincte des points de recommandation rules-v2 et des preuves issues de benchmarks publics.
Score éditorial d’adéquation produit : 10 indique une meilleure adéquation à la dimension nommée ; toutes les dimensions sont affichées à égalité et ne sont jamais combinées pour désigner un vainqueur global.
Intelligence
0–10Adéquation éditoriale aux travaux généraux, vastes et complexes, fondée sur les fonctionnalités documentées, le rôle dans le catalogue et les contraintes connues du produit ; il ne s’agit ni d’un QI ni d’un score de benchmark.
Développement
0–10Adéquation éditoriale à la planification logicielle, à la mise en œuvre, au débogage, à la revue et aux processus de dépôt ; il ne s’agit pas d’un taux de réussite mesuré.
Raisonnement
0–10Adéquation éditoriale à l’analyse en plusieurs étapes, à la gestion des contraintes et à la résolution structurée de problèmes ; il ne s’agit pas de la reproduction d’un benchmark de raisonnement.
Rédaction
0–10Adéquation éditoriale aux processus de rédaction, de révision, de production de contenus longs et de documentation ; il ne s’agit pas d’un résultat mesuré portant sur le style ou l’exactitude factuelle.
Vitesse
0–10Adéquation éditoriale à l’itération réactive, fondée sur le positionnement du produit et son mode de mise à disposition ; il ne s’agit pas d’une mesure de latence.
Rapport coût-efficacité
0–10Adéquation éditoriale à la maîtrise des prix d’accès et des coûts d’exploitation, fondée sur les niveaux répertoriés et le mode de déploiement ; il ne s’agit ni d’un calcul du coût total ni d’une garantie de prix.
Contrôle de la confidentialité
0–10Adéquation éditoriale au contrôle du déploiement et des données, fondée sur une classification locale, hybride ou cloud ; il ne s’agit pas d’un audit de sécurité, de conformité ou de télémétrie.
Écosystème
0–10Adéquation éditoriale aux outils, intégrations, plateformes et options de déploiement disponibles ; il ne s’agit ni d’une mesure de part de marché ni d’une mesure de la qualité des intégrations.
Pondérations et agrégation
Chaque dimension bénéficie de la même importance visuelle. Il n’existe aucune pondération arithmétique, moyenne, note totale ou vainqueur global ; l’utilisateur détermine quelles dimensions importent dans les conditions indiquées.
Limite du jugement éditorial humain
Les éditeurs attribuent des indicateurs entiers d’adéquation de 0 à 10 à partir du barème, des informations produit confirmées par les fournisseurs et des classifications du catalogue. Un score ne constitue ni une mesure d’une version exacte, ni un résultat de benchmark, ni une probabilité, ni une garantie du fournisseur.
Sources
Les pages officielles des fournisseurs étayent l’identité, l’accès, les fonctionnalités publiées, les options de déploiement et les tarifs affichés. Les libellés « idéal pour », les points forts, les faiblesses, les classifications et toutes les valeurs de 0 à 10 d’OpenGPT sont des données éditoriales.
Examen du catalogue
Dernier examen du catalogue:
Confiance: Couverture éditoriale moyenne
La confiance décrit l’exhaustivité de la couverture du catalogue et de l’explication, et non la probabilité de performances élevées. Les informations des fournisseurs peuvent évoluer et l’indicateur d’adéquation n’a pas été mesuré de façon indépendante.
Applicabilité
Utilisez les scores pour comparer les entrées du catalogue selon la dimension indiquée et les hypothèses actuelles sur le produit et le déploiement. Ne considérez pas les écarts de score comme des différences de performance mesurées.
Avant l’adoption, vérifiez les informations actuelles du fournisseur et testez la version exacte du modèle, le niveau de service, les outils, la région et un échantillon représentatif du travail.
Méthode publiée · rules-v2
Comment OpenGPT produit ses recommandations
Le Configurateur transforme un profil local en présélection déterministe. Les points ci-dessous classent l’adéquation éditoriale des produits après application de critères éliminatoires de budget et de confidentialité ; ils ne mesurent pas la qualité des modèles.
Dimensions de notation et points additifs prévus par les règles
Les points sont des pondérations conditionnelles, et non des pourcentages. Un critère éliminatoire écarte tout élément inadmissible avant la notation.
Adéquation à la tâche et à l’objectif
Model · ToolLes modèles obtiennent +12 pour chaque tâche sélectionnée correspondante et +10 pour une correspondance exacte de l’objectif. Les outils obtiennent +10 pour chaque cas d’usage sélectionné correspondant.
User-declared conditions · OpenGPT editorial catalogConfidentialité et déploiement
Model · ToolUne confidentialité élevée exclut les modèles non locaux et les outils non classés comme hautement confidentiels. Les modèles locaux admissibles obtiennent +30 et les outils à confidentialité élevée +12. Pour une confidentialité moyenne, les modèles hybrides, locaux et cloud obtiennent respectivement +8, +5 et +2.
User-declared conditions · OpenGPT editorial catalogAdmissibilité budgétaire
Model · ToolLes éléments qui se situent en dehors de la tranche de prix indiquée sont exclus. Les modèles admissibles obtiennent +12 et les outils +8 ; un modèle de profil gratuit doté d’un accès gratuit répertorié obtient +16 supplémentaires.
User-declared conditions · Provider-published facts · OpenGPT editorial catalogAdéquation au rôle professionnel
Model · ToolLes correspondances entre étudiants et modèles reçoivent +10 ; les autres correspondances prises en charge entre modèles et rôles, +8. Les correspondances entre étudiants et outils reçoivent +8 ; les autres correspondances prises en charge entre outils et rôles, +6.
User-declared conditions · OpenGPT editorial catalogIndicateurs sectoriels
Model · ToolLes termes sectoriels reconnus sont associés à des catégories de tâches. Les modèles reçoivent +5 et les outils +4 pour chaque correspondance avec une tâche associée. Le texte libre lui-même n’est pas copié dans le processus.
User-declared conditions · OpenGPT editorial catalogAdéquation linguistique
ModèlePour une préférence autre que l’anglais, une correspondance multilingue dans le catalogue obtient +14 et une absence de correspondance −3. Pour l’anglais, l’adéquation à la rédaction ou à la documentation obtient +3.
User-declared conditions · OpenGPT editorial catalogAdéquation à la plateforme
Model · ToolLa correspondance du modèle obtient +3 pour le web, +10 pour l’ordinateur, +8 pour le terminal, +7 pour l’API et +9 pour le mobile. Les outils obtiennent +7 par plateforme correspondante ou −3 lorsqu’aucune ne correspond.
User-declared conditions · OpenGPT editorial catalogAdéquation au niveau d’expérience
Model · ToolL’adéquation du modèle vaut +10 pour les débutants (ou −4 en cas d’inadéquation avec un modèle local), +7 pour les utilisateurs avancés et +2 pour les utilisateurs intermédiaires avec un modèle de pointe ou hybride. L’adéquation des outils vaut respectivement +6 et +5 pour les débutants et les utilisateurs avancés.
User-declared conditions · OpenGPT editorial catalogSélection et ex æquo
Model · ToolLes candidats admissibles sont triés selon les points des règles ; les ex æquo sont départagés par ordre alphabétique. Les rôles sont attribués dans un ordre fixe et jusqu’à trois autres modèles correspondants deviennent des alternatives.
Règles déterministes v2Sources et limites des affirmations
Informations publiées par le fournisseur
Les pages officielles des fournisseurs étayent l’identité, l’accès, les descriptions des fonctionnalités publiées et les tarifs affichés. OpenGPT ne considère pas ces pages comme des tests de performance indépendants.
Catalogue éditorial OpenGPT
Les libellés « idéal pour », les points forts, les classifications de confidentialité et de déploiement ainsi que les indicateurs d’adéquation produit sont des appréciations éditoriales. Il ne s’agit ni de mesures de benchmark ni de garanties des fournisseurs.
Conditions déclarées par l’utilisateur
L’objectif, les tâches, le rôle, le budget, la confidentialité, la langue, la plateforme, les compétences et les indicateurs sectoriels proviennent du profil local de l’utilisateur. Ils décrivent l’applicabilité, pas des preuves externes.
Règles déterministes v2
Le même profil normalisé et le même instantané du catalogue produisent le même ordre. L’arithmétique peut être expliquée, mais le déterminisme ne transforme pas les données éditoriales en faits.
Contexte des benchmarks publics
Les classements publics restent des preuves distinctes. rules-v2 n’ajoute ni rang ni score de benchmark aux points de recommandation ; utilisez-les après la présélection et conservez le périmètre propre à chaque source.
Faits et jugement éditorial
Les affirmations factuelles doivent renvoyer à une source nommée du fournisseur ou du benchmark, à une identité exacte lorsqu’elle est disponible et à une date d’examen.
Les libellés d’adéquation, points forts, classifications, hypothèses, niveaux de confiance et recommandations sont des appréciations éditoriales d’OpenGPT. Ils ne doivent pas être présentés comme des résultats mesurés pour une version exacte.
Fréquence d’examen et niveau de confiance
La méthodologie et les fiches de recommandation actives font l’objet d’un examen planifié au moins tous les 90 jours, ainsi que d’examens déclenchés par des événements. Chaque résultat doit utiliser la date d’examen de sa fiche, pas celle de cette page.
L’examen est déclenché lorsque
- Un fournisseur modifie l’ID, le cycle de vie, le chemin d’accès, une déclaration de capacité ou le prix affiché d’un modèle.
- Le moteur de recommandation, les pondérations, les critères éliminatoires ou la taxonomie éditoriale changent.
- Une correction signale une erreur importante concernant la source, l’identité, le tarif, la confidentialité ou l’applicabilité.
Règles de confiance
La confiance décrit l’exhaustivité de l’explication de l’adéquation et de la fiche qui l’étaye. Elle n’exprime pas la probabilité que le modèle soit performant.
- Élevé
- L’identité exacte et une source factuelle actuelle sont présentes ; les champs importants sont résolus, les hypothèses sont visibles et une alternative qualifiée est nommée.
- Moyen
- La correspondance peut être expliquée, mais une source, une condition ou un fait actuel doit être confirmé avant toute adoption.
- Faible
- L’identité, l’actualité, les tarifs, la confidentialité ou l’applicabilité présentent une lacune importante. Considérez cet élément uniquement comme un candidat à étudier.
Applicabilité et conditions
- S’applique à la présélection éditoriale rules-v2 générée à partir du catalogue actuel et vérifié des modèles et outils.
- Le résultat dépend du profil soumis et de l’instantané du catalogue ; la modification de l’un ou l’autre peut modifier le résultat.
- Il s’agit d’une aide à la décision à faibles enjeux, et non d’une preuve de qualité, du prix en temps réel, d’une position dominante dans un benchmark, de sécurité, de légalité ou d’aptitude à un usage réglementé.
Affichage d’audit obligatoire pour chaque résultat
Une recommandation intégrée doit présenter les sept champs ci-dessous sans obliger l’utilisateur à déduire la limite des preuves.
- Pourquoi
- Preuves
- Hypothèses
- Dernier examen
- Confiance
- Meilleure alternative
- Quand ne pas choisir cette option
D’une tâche réelle à une conclusion vérifiable
Définir le test
Avant toute comparaison, consignez la tâche, les critères de réussite, les entrées, les contraintes, les versions exactes des modèles, les paramètres et la date.
Utiliser les mêmes conditions
Soumettez la même tâche et le même barème à chaque candidat. Les libellés masqués réduisent le biais lié à la visibilité des noms, mais il ne s’agit ni d’un test en double aveugle ni d’un test exécuté indépendamment.
Conserver les données sources
Enregistrez les prompts, les réponses, les scores, les erreurs, la latence et les hachages. Ne remplacez pas les preuves manquantes par des estimations.
Énoncer les limites
Affichez l’incertitude, la taille de l’échantillon, les exclusions, les contradictions et ce que le résultat ne prouve pas.
Niveaux de preuve
Evidence v1/v2 vérifie le format du fichier et la cohérence déclarée. L’Espace décisionnel V3 recalcule également les hachages, attributions, correspondances, scores et synthèses à partir des entrées enregistrées. Cela ne prouve pas une reproduction indépendante de niveau L4.
Format vérifié
Le fichier respecte le schéma déclaré et ne contient aucun champ secret évident.
Fiche complète
La cible est une fiche cohérente des tâches, des paramètres, des déclarations de modèles et de la date d’évaluation. V1 ne vérifie qu’une partie de cette fiche.
Recalculable
L’Espace décisionnel V3 inclut les résultats bruts collés et les données de notation afin d’assurer un recalcul local strict ; Evidence v1/v2 ne comporte pas les mêmes champs.
Reproduit indépendamment
Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.
Comment comparer les classements d’agents d’IA
Chaque ligne représente une configuration d’agent publiée dans le périmètre d’un benchmark nommé. Il ne s’agit pas d’un score du seul modèle de base.
Comparer les configurations système
Conservez ensemble tous les champs publiés par la source concernant l’agent, le modèle de base, l’échafaudage, l’outil, l’environnement, le budget et la date ; marquez les champs non publiés comme inconnus.
Conserver les échelles d’origine
Classez uniquement au sein d’un même benchmark, d’une même version, des mêmes règles de tâches et d’un groupe d’exécutions comparable. OpenGPT ne crée aucun score universel couvrant plusieurs benchmarks.
Indiquez l’état des preuves
Distinguez les fiches répertoriées par l’éditeur d’un benchmark, les contributions contrôlées en amont, les rapports des fournisseurs et les exécutions de la communauté.
Conserver les preuves opérationnelles
Affichez le coût, la latence, les étapes et les interventions humaines lorsque la source fournit des valeurs comparables ; laissez les valeurs manquantes comme inconnues.
Ce que la validation locale peut établir
- ✓Champs obligatoires et types de données pris en charge
- ✓Cohérence interne des scores, des exécutions, des dates et des hachages
- ✓Si le paquet indique qu’il contient des données de démonstration
- ✓Absence de champs courants de clés d’API et de secrets
Ce que cela ne peut établir à lui seul
- —Que le fournisseur ou le modèle déclaré a réellement produit le résultat
- —Qu’un score est exempt de biais de sélection ou d’une conception de test insuffisante
- —Qu’un résultat s’applique à chaque tâche, langue, utilisateur ou future version de modèle
- —Qu’un modèle est sûr, légal ou adapté à une décision à fort enjeu
Principes de publication
Aucun paiement pour être classé
Un parrainage peut être déclaré, mais il ne peut modifier ni la notation, ni les critères de preuve, ni le positionnement.
Les versions, pas les marques
Une série de modèles n’est pas un objet de test stable. Les ID exacts des modèles, les paramètres, la région et la date sont déterminants.
Des tâches réelles avant toute généralisation
OpenGPT recommande des sélections selon les exigences, puis demande aux utilisateurs de tester leur propre travail représentatif.
L’incertitude est un résultat
Les ex æquo, les petits échantillons, les exécutions en échec et les preuves non concluantes doivent rester visibles.