Agent-benchmarks

τ²-bench Core agent-benchmark

OpenGPT houdt 8 gepubliceerde rijen gekoppeld aan de exacte τ²-bench Core-benchmarkversie en hieronder weergegeven omgeving.

Taken
278
Gepubliceerde rijen
8
Datum van brongegevens
Identiteit beoordeeld
Actueel

Bewijsbereik

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials. base tasks across retail, airline, and telecom. Standard agent, standard domain tools, and a shared GPT-5.2 low-reasoning user simulator. 4 trials per task · 1,112 trajectories per configuration.

How OpenGPT handles this evidence

OpenGPT behoudt de meetwaarde, het taakbereik, de omgeving, versie, configuratievelden en brondatum van de uitgever. Het maakt geen algehele Agent-score over benchmarks heen.

Vergelijkingsgrenzen

  • Een hoger resultaat geldt alleen voor de weergegeven benchmarkversie en de bijbehorende voorwaarden.
  • Agentresultaten weerspiegelen het volledige systeem, niet alleen het basismodel.
  • Ontbrekende gegevens over kosten, betrouwbaarheid, veiligheid of latentie worden niet afgeleid maar blijven niet-gerapporteerd.
  • OpenGPT bevat alleen de acht door uitgevers ingediende rijen met dezelfde benchmark v1.0.1, standaardscaffold en -hulpmiddelen, dezelfde gebruikerssimulator, dezelfde basistaaksplitsingen en vier pogingen. Andere τ-bench-rijen vallen buiten dit bereik.

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials

8 van 8 gepubliceerde rijen weergegeven. Elk resultaat blijft gekoppeld aan de bronbenchmark en configuratie.

  1. τ² standard agent · Qwen3.5-397B-A17B · thinkingAlibaba Cloud · Qwen3.5-397B-A17B#1Average Pass¹: 87.91%τ² standard agent
  2. τ² standard agent · Claude Opus 4.5 · hoogAnthropic · Claude Opus 4.5#2Average Pass¹: 85.31%τ² standard agent
  3. τ² standard agent · GPT-5.2 · hoogOpenAI · GPT-5.2#3Average Pass¹: 84.76%τ² standard agent
  4. τ² standard agent · Gemini 3 Flash Preview · hoogGoogle · Gemini 3 Flash Preview#4Average Pass¹: 83.49%τ² standard agent
  5. τ² standard agent · Gemini 3 Pro Preview · hoogGoogle · Gemini 3 Pro Preview#5Average Pass¹: 82.46%τ² standard agent
  6. τ² standard agent · GLM-5 · thinkingZhipu AI · GLM-5#6Average Pass¹: 81.01%τ² standard agent
  7. τ² standard agent · Claude Sonnet 4.5 · uitgebreid denkenAnthropic · Claude Sonnet 4.5#7Average Pass¹: 76.41%τ² standard agent
  8. τ² standard agent · GPT-5.2 · geen redeneringOpenAI · GPT-5.2#8Average Pass¹: 61.58%τ² standard agent