Agenten-Benchmarks

τ³-Banking Knowledge Agenten-Benchmark

OpenGPT hält 21 veröffentlichte Zeilen mit der unten gezeigten exakten Benchmark-Version τ³-Banking Knowledge und Umgebung verknüpft.

Aufgaben
97
Veröffentlichte Zeilen
21
Datum der Quelldaten
Identität geprüft
Aktuell

Nachweisumfang

v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials. banking knowledge tasks. Standard scaffold with BM25, embedding retrieval, and sandboxed command-line search. 4 trials per task · 388 trajectories per configuration.

How OpenGPT handles this evidence

OpenGPT bewahrt Kennzahl, Aufgabenumfang, Umgebung, Version, Konfigurationsfelder und Quelldatum des Herausgebers. Es erstellt keine Benchmark-übergreifende Agent-Gesamtpunktzahl.

Vergleichsgrenzen

  • Ein höheres Ergebnis gilt nur für die angezeigte Benchmark-Version und die entsprechenden Bedingungen.
  • Die Ergebnisse der Agenten spiegeln das Gesamtsystem wider, nicht nur das Basismodell.
  • Fehlende Daten zu Kosten, Zuverlässigkeit, Sicherheit oder Latenz werden weiterhin als nicht gemeldet ausgewiesen und nicht abgeleitet.
  • Die enthaltenen Zeilen verwenden dieselbe Benchmark-Version, denselben Banking Knowledge-Split mit 97 Aufgaben, dieselbe AllTools-Konfiguration, denselben Nutzersimulator, Seed und dasselbe Protokoll mit vier Durchläufen. Fehlende Kosten werden weiterhin nicht ausgewiesen. Diese Momentaufnahme enthält alle 21 kompatiblen Herausgebereinreichungen, die beim fixierten Revisionsstand verfügbar waren.

v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials

21 von 21 veröffentlichten Zeilen werden angezeigt. Jedes Ergebnis bleibt mit dem Quellbenchmark und der Konfiguration verknüpft.

  1. τ³ Banking AllTools · Qwen 3.8 Max · xhighQwen · Qwen 3.8 Max#1Pass¹: 55.15%τ³ standard agent
  2. τ³ Banking AllTools · Claude Opus 5 · maxAnthropic · Claude Opus 5#2Pass¹: 48.71%τ³ standard agent
  3. τ³ Banking AllTools · Grok 4.5 · hochxAI · Grok 4.5#3Pass¹: 47.94%τ³ standard agent
  4. τ³ Banking AllTools · GPT-5.6-sol · xhighOpenAI · GPT-5.6-sol#4Pass¹: 46.91%τ³ standard agent
  5. τ³ Banking AllTools · GPT-5.5 · xhighOpenAI · GPT-5.5#5Pass¹: 44.59%τ³ standard agent
  6. τ³ Banking AllTools · Muse Spark 1.1 · xhighMeta · Muse Spark 1.1#6Pass¹: 40.46%τ³ standard agent
  7. τ³ Banking AllTools · Claude Opus 4.7 · maxAnthropic · Claude Opus 4.7#7Pass¹: 40.21%τ³ standard agent
  8. τ³ Banking AllTools · Claude Fable 5 · maxAnthropic · Claude Fable 5#8Pass¹: 39.69%τ³ standard agent
  9. τ³ Banking AllTools · Claude Opus 4.8 · maxAnthropic · Claude Opus 4.8#9Pass¹: 39.69%τ³ standard agent
  10. τ³ Banking AllTools · GPT-5.4 · xhighOpenAI · GPT-5.4#10Pass¹: 39.43%τ³ standard agent
  11. τ³ Banking AllTools · GLM-5.2 · xhighZ.ai · GLM-5.2#11Pass¹: 37.11%τ³ standard agent
  12. τ³ Banking AllTools · Kimi K3 · maxMoonshot AI · Kimi K3#12Pass¹: 37.11%τ³ standard agent
  13. τ³ Banking AllTools · GPT-5.2 · hochOpenAI · GPT-5.2#13Pass¹: 32.22%τ³ standard agent
  14. τ³ Banking AllTools · Claude Opus 4.6 · maxAnthropic · Claude Opus 4.6#14Pass¹: 27.32%τ³ standard agent
  15. τ³ Banking AllTools · Gemini 3.1 Pro Preview · hochGoogle · Gemini 3.1 Pro Preview#15Pass¹: 26.03%τ³ standard agent
  16. τ³ Banking AllTools · Inkling · maxThinking Machines Lab · Inkling#16Pass¹: 25.00%τ³ standard agent
  17. τ³ Banking AllTools · Claude Opus 4.5 · hochAnthropic · Claude Opus 4.5#17Pass¹: 24.74%τ³ standard agent
  18. τ³ Banking AllTools · Grok 4.2 · hochxAI · Grok 4.2#18Pass¹: 18.04%τ³ standard agent
  19. τ³ Banking AllTools · Grok 4 fast · hochxAI · Grok 4 fast#19Pass¹: 15.72%τ³ standard agent
  20. τ³ Banking AllTools · Gemini 2.5 Pro · hochGoogle · Gemini 2.5 Pro#20Pass¹: 13.66%τ³ standard agent
  21. τ³ Banking AllTools · Grok 4.1 fast · hochxAI · Grok 4.1 fast#21Pass¹: 13.14%τ³ standard agent