Configurazione dell’Agent · τ²-bench Core

τ² standard agent · Qwen3.5-397B-A17B · thinking

L’oggetto classificato: modello, scaffold, strumenti, autorizzazioni, budget e ambiente nel loro insieme.

Superamento medio¹87.91%
Costo per attività riuscitaNon pubblicato
Intervallo dei risultati pubblicatiNon pubblicato

01

Configurazione

Sistema Agentτ² standard agent · Qwen3.5-397B-A17B · thinking
Modello di baseQwen3.5-397B-A17B
ID o etichetta del modello della fonteQwen3.5-397B-A17B · thinking
Scaffoldτ² standard agent
Versione dello scaffoldv1.0.1
StrumentiStandard retail, airline, and telecom domain tools
AmbienteAgente standard e strumenti di dominio con un simulatore utente condiviso GPT-5.2 a ragionamento ridotto
Budget4 prove per attività · 1.112 traiettorie per configurazione

02

Esito

Superamento medio¹87.91%
Punteggio parzialeNon pubblicato
Costo per attività riuscitaNon pubblicato
Costo di benchmark indicatoNon indicato
Tempo mediano di completamentoNon pubblicato
Intervento umanoNon pubblicato

03

Operazione

Evidenze delle esecuzioni ripetute4 esecuzioni
Intervallo dei risultati pubblicatiNon pubblicato
Nota sulla sicurezzaNon pubblicato
Gruppo di comparabilitàtau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
Data della valutazione
Dati acquisiti

04

Attendibilità

EvidenzeElencato dal publisher del benchmark
FonteSierra Research · τ²-bench
Istantanea della fontev1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
Data dei dati della fonte
Recuperato da OpenGPT
Ultima modifica della classificaAncora nessuna cronologia comparabile
Ultimo controllo
Attività278 attività di base nei settori vendita al dettaglio, compagnie aeree e telecomunicazioni
Livello delle evidenzeGestito dal publisher
Nota sulle evidenze

Sono incluse soltanto otto righe inviate dal publisher con lo stesso benchmark v1.0.1, scaffold e strumenti standard, simulatore utente, suddivisioni delle attività di base e protocollo a quattro prove. Le altre righe τ-bench restano fuori da questo ambito.

Apri l’audit

Cosa non dimostra questo risultato

Questo risultato si applica alle condizioni esatte del sistema e della fonte qui indicate. Non stabilisce quale sia il miglior agente in assoluto, né l’affidabilità in produzione, la governance dei dati o le prestazioni su una versione diversa del benchmark.

Confronta elementi omogenei

Soltanto configurazioni della stessa versione del benchmark e dello stesso ambito di attività possono essere inserite in un unico confronto.

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.

Convalida prima dell’adozione

Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.

  1. 1

    Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.

  2. 2

    Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.

  3. 3

    Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.

  4. 4

    Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.

Directory e valutazioni degli Agent