Benchmarks d’Agents
Benchmark d’agents de τ³-Banking Knowledge
OpenGPT conserve 21 lignes publiées, associées à la version τ³-Banking Knowledge exacte du benchmark et à l’environnement indiqués ci-dessous.
- Tâches
- 97
- Lignes publiées
- 21
- Date des données sources
- Identité examinée
- À jour
Périmètre des preuves
v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials. banking knowledge tasks. Standard scaffold with BM25, embedding retrieval, and sandboxed command-line search. 4 trials per task · 388 trajectories per configuration.
How OpenGPT handles this evidence
OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.
Limites de la comparaison
- Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
- Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
- Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
- Les lignes incluses utilisent la même version de benchmark, le même segment Banking Knowledge de 97 tâches, la même configuration AllTools, le même simulateur d’utilisateur, la même graine et le même protocole à quatre essais. Les coûts manquants restent non déclarés. Cet instantané comprend les 21 soumissions compatibles de l’éditeur disponibles à la révision épinglée.
v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials
Affichage de 21 lignes publiées sur 21. Chaque résultat reste associé au benchmark et à la configuration de sa source.
- τ³ Banking AllTools · Qwen 3.8 Max · xhighQwen · Qwen 3.8 Max#1Pass¹: 55.15%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 5 · maxAnthropic · Claude Opus 5#2Pass¹: 48.71%τ³ standard agent
- τ³ Banking AllTools · Grok 4.5 · élevéxAI · Grok 4.5#3Pass¹: 47.94%τ³ standard agent
- τ³ Banking AllTools · GPT-5.6-sol · xhighOpenAI · GPT-5.6-sol#4Pass¹: 46.91%τ³ standard agent
- τ³ Banking AllTools · GPT-5.5 · xhighOpenAI · GPT-5.5#5Pass¹: 44.59%τ³ standard agent
- τ³ Banking AllTools · Muse Spark 1.1 · xhighMeta · Muse Spark 1.1#6Pass¹: 40.46%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.7 · maxAnthropic · Claude Opus 4.7#7Pass¹: 40.21%τ³ standard agent
- τ³ Banking AllTools · Claude Fable 5 · maxAnthropic · Claude Fable 5#8Pass¹: 39.69%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.8 · maxAnthropic · Claude Opus 4.8#9Pass¹: 39.69%τ³ standard agent
- τ³ Banking AllTools · GPT-5.4 · xhighOpenAI · GPT-5.4#10Pass¹: 39.43%τ³ standard agent
- τ³ Banking AllTools · GLM-5.2 · xhighZ.ai · GLM-5.2#11Pass¹: 37.11%τ³ standard agent
- τ³ Banking AllTools · Kimi K3 · maxMoonshot AI · Kimi K3#12Pass¹: 37.11%τ³ standard agent
- τ³ Banking AllTools · GPT-5.2 · élevéOpenAI · GPT-5.2#13Pass¹: 32.22%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.6 · maxAnthropic · Claude Opus 4.6#14Pass¹: 27.32%τ³ standard agent
- τ³ Banking AllTools · Gemini 3.1 Pro Preview · élevéGoogle · Gemini 3.1 Pro Preview#15Pass¹: 26.03%τ³ standard agent
- τ³ Banking AllTools · Inkling · maxThinking Machines Lab · Inkling#16Pass¹: 25.00%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.5 · élevéAnthropic · Claude Opus 4.5#17Pass¹: 24.74%τ³ standard agent
- τ³ Banking AllTools · Grok 4.2 · élevéxAI · Grok 4.2#18Pass¹: 18.04%τ³ standard agent
- τ³ Banking AllTools · Grok 4 fast · élevéxAI · Grok 4 fast#19Pass¹: 15.72%τ³ standard agent
- τ³ Banking AllTools · Gemini 2.5 Pro · élevéGoogle · Gemini 2.5 Pro#20Pass¹: 13.66%τ³ standard agent
- τ³ Banking AllTools · Grok 4.1 fast · élevéxAI · Grok 4.1 fast#21Pass¹: 13.14%τ³ standard agent