Benchmark degli Agent

Benchmark degli agenti di τ²-bench Core

OpenGPT mantiene 8 righe pubblicate associate alla versione esatta del benchmark τ²-bench Core e all’ambiente mostrato sotto.

Attività
278
Righe pubblicate
8
Data dei dati della fonte
Identità esaminata
Attuale

Ambito delle evidenze

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials. base tasks across retail, airline, and telecom. Standard agent, standard domain tools, and a shared GPT-5.2 low-reasoning user simulator. 4 trials per task · 1,112 trajectories per configuration.

How OpenGPT handles this evidence

OpenGPT conserva la metrica, l’ambito delle attività, l’ambiente, la versione, i campi della configurazione e la data della fonte indicati dal publisher. Non crea un punteggio complessivo degli Agent tra benchmark diversi.

Limiti del confronto

  • Un risultato più elevato si applica solo alla versione del benchmark e alle condizioni visualizzate.
  • I risultati degli Agent riflettono il sistema completo, non soltanto il modello di base.
  • I dati mancanti su costi, affidabilità, sicurezza o latenza restano non indicati anziché essere dedotti.
  • OpenGPT include soltanto le otto righe inviate dal publisher che condividono il benchmark v1.0.1, lo scaffold e gli strumenti standard, lo stesso simulatore utente, le stesse suddivisioni delle attività di base e quattro prove. Le altre righe τ-bench restano fuori da questo ambito.

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials

Visualizzate 8 di 8 righe pubblicate. Ogni risultato rimane associato al benchmark e alla configurazione della fonte.

  1. τ² standard agent · Qwen3.5-397B-A17B · thinkingAlibaba Cloud · Qwen3.5-397B-A17B#1Average Pass¹: 87.91%τ² standard agent
  2. τ² standard agent · Claude Opus 4.5 · altoAnthropic · Claude Opus 4.5#2Average Pass¹: 85.31%τ² standard agent
  3. τ² standard agent · GPT-5.2 · altoOpenAI · GPT-5.2#3Average Pass¹: 84.76%τ² standard agent
  4. τ² standard agent · Gemini 3 Flash Preview · altoGoogle · Gemini 3 Flash Preview#4Average Pass¹: 83.49%τ² standard agent
  5. τ² standard agent · Gemini 3 Pro Preview · altoGoogle · Gemini 3 Pro Preview#5Average Pass¹: 82.46%τ² standard agent
  6. τ² standard agent · GLM-5 · thinkingZhipu AI · GLM-5#6Average Pass¹: 81.01%τ² standard agent
  7. τ² standard agent · Claude Sonnet 4.5 · ragionamento estesoAnthropic · Claude Sonnet 4.5#7Average Pass¹: 76.41%τ² standard agent
  8. τ² standard agent · GPT-5.2 · nessun ragionamentoOpenAI · GPT-5.2#8Average Pass¹: 61.58%τ² standard agent