Documents et questions-réponses ancrées dans les sources
Fichiers longs, synthèses, citations et réponses limitées au texte fourni.
- Pourquoi ces candidats
- Assumption · Historical. Comparez les modèles conçus pour les contextes persistants ou la récupération en entreprise, puis testez le comportement exact en matière de citations et de refus.
- Ce qui reste incertain
- Les affirmations sur la fenêtre de contexte ne prouvent ni la qualité de la récupération ni l’utilisation fidèle d’un long document.
Trois versions officielles à tester en priorité
Les données publiques réduisent le champ des possibilités. Elles ne remplacent pas un test contrôlé sur vos propres tâches. Sélectionnez deux ou trois candidats pour une comparaison côte à côte des données publiques.
Unknown · Not automatically certified
Aucun résultat public comparable n’est actuellement associé à cette version exacte.
Preuve publiqueLes modèles utilisent différentes échelles de preuves publiques. Les preuves manquantes ne sont pas assimilées à zéro et OpenGPT ne combine pas des sources différentes en un seul score.+
Un point de départ pratique, pas un gagnant universelSélectionnez deux ou trois candidats pour une comparaison côte à côte des données publiques.+
Les modèles utilisent différentes échelles de preuves publiques. Les preuves manquantes ne sont pas assimilées à zéro et OpenGPT ne combine pas des sources différentes en un seul score.
Les affirmations sur la fenêtre de contexte ne prouvent ni la qualité de la récupération ni l’utilisation fidèle d’un long document.
L’évaluation s’ouvre avec ce modèle de tâche et les deux premiers modèles sélectionnés. Vous pouvez modifier chaque tâche avant de recueillir les réponses.