Agenten-Benchmarks

τ²-bench Core Agenten-Benchmark

OpenGPT hält 8 veröffentlichte Zeilen mit der unten gezeigten exakten Benchmark-Version τ²-bench Core und Umgebung verknüpft.

Aufgaben
278
Veröffentlichte Zeilen
8
Datum der Quelldaten
Identität geprüft
Aktuell

Nachweisumfang

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials. base tasks across retail, airline, and telecom. Standard agent, standard domain tools, and a shared GPT-5.2 low-reasoning user simulator. 4 trials per task · 1,112 trajectories per configuration.

How OpenGPT handles this evidence

OpenGPT bewahrt Kennzahl, Aufgabenumfang, Umgebung, Version, Konfigurationsfelder und Quelldatum des Herausgebers. Es erstellt keine Benchmark-übergreifende Agent-Gesamtpunktzahl.

Vergleichsgrenzen

  • Ein höheres Ergebnis gilt nur für die angezeigte Benchmark-Version und die entsprechenden Bedingungen.
  • Die Ergebnisse der Agenten spiegeln das Gesamtsystem wider, nicht nur das Basismodell.
  • Fehlende Daten zu Kosten, Zuverlässigkeit, Sicherheit oder Latenz werden weiterhin als nicht gemeldet ausgewiesen und nicht abgeleitet.
  • OpenGPT enthält nur die acht vom Herausgeber eingereichten Zeilen, die Benchmark v1.0.1, das Standard-Scaffold und die Standardtools, denselben Nutzersimulator, dieselben grundlegenden Aufgabenaufteilungen und vier Durchläufe gemeinsam haben. Andere τ-bench-Zeilen bleiben außerhalb dieses Umfangs.

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials

8 von 8 veröffentlichten Zeilen werden angezeigt. Jedes Ergebnis bleibt mit dem Quellbenchmark und der Konfiguration verknüpft.

  1. τ² standard agent · Qwen3.5-397B-A17B · thinkingAlibaba Cloud · Qwen3.5-397B-A17B#1Average Pass¹: 87.91%τ² standard agent
  2. τ² standard agent · Claude Opus 4.5 · hochAnthropic · Claude Opus 4.5#2Average Pass¹: 85.31%τ² standard agent
  3. τ² standard agent · GPT-5.2 · hochOpenAI · GPT-5.2#3Average Pass¹: 84.76%τ² standard agent
  4. τ² standard agent · Gemini 3 Flash Preview · hochGoogle · Gemini 3 Flash Preview#4Average Pass¹: 83.49%τ² standard agent
  5. τ² standard agent · Gemini 3 Pro Preview · hochGoogle · Gemini 3 Pro Preview#5Average Pass¹: 82.46%τ² standard agent
  6. τ² standard agent · GLM-5 · thinkingZhipu AI · GLM-5#6Average Pass¹: 81.01%τ² standard agent
  7. τ² standard agent · Claude Sonnet 4.5 · erweitertes ReasoningAnthropic · Claude Sonnet 4.5#7Average Pass¹: 76.41%τ² standard agent
  8. τ² standard agent · GPT-5.2 · kein SchlussfolgernOpenAI · GPT-5.2#8Average Pass¹: 61.58%τ² standard agent