Benchmarks d’Agents

Benchmark d’agents de τ³-Banking Knowledge

OpenGPT conserve 21 lignes publiées, associées à la version τ³-Banking Knowledge exacte du benchmark et à l’environnement indiqués ci-dessous.

Tâches
97
Lignes publiées
21
Date des données sources
Identité examinée
À jour

Périmètre des preuves

v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials. banking knowledge tasks. Standard scaffold with BM25, embedding retrieval, and sandboxed command-line search. 4 trials per task · 388 trajectories per configuration.

How OpenGPT handles this evidence

OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.

Limites de la comparaison

  • Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
  • Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
  • Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
  • Les lignes incluses utilisent la même version de benchmark, le même segment Banking Knowledge de 97 tâches, la même configuration AllTools, le même simulateur d’utilisateur, la même graine et le même protocole à quatre essais. Les coûts manquants restent non déclarés. Cet instantané comprend les 21 soumissions compatibles de l’éditeur disponibles à la révision épinglée.

v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials

Affichage de 21 lignes publiées sur 21. Chaque résultat reste associé au benchmark et à la configuration de sa source.

  1. τ³ Banking AllTools · Qwen 3.8 Max · xhighQwen · Qwen 3.8 Max#1Pass¹: 55.15%τ³ standard agent
  2. τ³ Banking AllTools · Claude Opus 5 · maxAnthropic · Claude Opus 5#2Pass¹: 48.71%τ³ standard agent
  3. τ³ Banking AllTools · Grok 4.5 · élevéxAI · Grok 4.5#3Pass¹: 47.94%τ³ standard agent
  4. τ³ Banking AllTools · GPT-5.6-sol · xhighOpenAI · GPT-5.6-sol#4Pass¹: 46.91%τ³ standard agent
  5. τ³ Banking AllTools · GPT-5.5 · xhighOpenAI · GPT-5.5#5Pass¹: 44.59%τ³ standard agent
  6. τ³ Banking AllTools · Muse Spark 1.1 · xhighMeta · Muse Spark 1.1#6Pass¹: 40.46%τ³ standard agent
  7. τ³ Banking AllTools · Claude Opus 4.7 · maxAnthropic · Claude Opus 4.7#7Pass¹: 40.21%τ³ standard agent
  8. τ³ Banking AllTools · Claude Fable 5 · maxAnthropic · Claude Fable 5#8Pass¹: 39.69%τ³ standard agent
  9. τ³ Banking AllTools · Claude Opus 4.8 · maxAnthropic · Claude Opus 4.8#9Pass¹: 39.69%τ³ standard agent
  10. τ³ Banking AllTools · GPT-5.4 · xhighOpenAI · GPT-5.4#10Pass¹: 39.43%τ³ standard agent
  11. τ³ Banking AllTools · GLM-5.2 · xhighZ.ai · GLM-5.2#11Pass¹: 37.11%τ³ standard agent
  12. τ³ Banking AllTools · Kimi K3 · maxMoonshot AI · Kimi K3#12Pass¹: 37.11%τ³ standard agent
  13. τ³ Banking AllTools · GPT-5.2 · élevéOpenAI · GPT-5.2#13Pass¹: 32.22%τ³ standard agent
  14. τ³ Banking AllTools · Claude Opus 4.6 · maxAnthropic · Claude Opus 4.6#14Pass¹: 27.32%τ³ standard agent
  15. τ³ Banking AllTools · Gemini 3.1 Pro Preview · élevéGoogle · Gemini 3.1 Pro Preview#15Pass¹: 26.03%τ³ standard agent
  16. τ³ Banking AllTools · Inkling · maxThinking Machines Lab · Inkling#16Pass¹: 25.00%τ³ standard agent
  17. τ³ Banking AllTools · Claude Opus 4.5 · élevéAnthropic · Claude Opus 4.5#17Pass¹: 24.74%τ³ standard agent
  18. τ³ Banking AllTools · Grok 4.2 · élevéxAI · Grok 4.2#18Pass¹: 18.04%τ³ standard agent
  19. τ³ Banking AllTools · Grok 4 fast · élevéxAI · Grok 4 fast#19Pass¹: 15.72%τ³ standard agent
  20. τ³ Banking AllTools · Gemini 2.5 Pro · élevéGoogle · Gemini 2.5 Pro#20Pass¹: 13.66%τ³ standard agent
  21. τ³ Banking AllTools · Grok 4.1 fast · élevéxAI · Grok 4.1 fast#21Pass¹: 13.14%τ³ standard agent