Configurazione dell’Agent · Terminal-Bench 2.1

Codex · GPT-5.5 · xhigh

L’oggetto classificato: modello, scaffold, strumenti, autorizzazioni, budget e ambiente nel loro insieme.

Accuratezza dell’attività83.2%
Costo per attività riuscitaNon pubblicato
Intervallo dei risultati pubblicati±2.2%

01

Configurazione

Sistema AgentCodex · GPT-5.5 · xhigh
Modello di baseGPT-5.5
ID o etichetta del modello della fonteGPT-5.5
ScaffoldCodex
Versione dello scaffoldNon indicato
StrumentiTerminal shell
AmbienteAmbienti terminale gestiti da Harbor
BudgetLimiti fissi · almeno 5 prove per attività

02

Esito

Accuratezza dell’attività83.2%
Punteggio parzialeNon pubblicato
Costo per attività riuscitaNon pubblicato
Costo di benchmark indicato2059,19 USD
Tempo mediano di completamentoNon pubblicato
Intervento umanoNon pubblicato

03

Operazione

Evidenze delle esecuzioni ripetuteNon pubblicato
Intervallo dei risultati pubblicati±2.2%
Nota sulla sicurezzaNon pubblicato
Gruppo di comparabilitàterminal-bench-2-1-main
Data della valutazione
Dati acquisiti

04

Attendibilità

EvidenzeElencato dal publisher del benchmark
FonteTerminal-Bench 2.1
Istantanea della fonteTerminal-Bench 2.1 · classifica verificata dall’editore
Data dei dati della fonte
Recuperato da OpenGPT
Ultima modifica della classifica
Ultimo controllo
Attività89 attività da terminale
Livello delle evidenzeGestito dal publisher
Nota sulle evidenze

Il team di Terminal-Bench dichiara di aver eseguito e verificato questi invii. La release 2.1 ha modificato le attività e l’ambiente di valutazione.

Apri l’audit

Cosa non dimostra questo risultato

Questo risultato si applica alle condizioni esatte del sistema e della fonte qui indicate. Non stabilisce quale sia il miglior agente in assoluto, né l’affidabilità in produzione, la governance dei dati o le prestazioni su una versione diversa del benchmark.

Confronta elementi omogenei

Soltanto configurazioni della stessa versione del benchmark e dello stesso ambito di attività possono essere inserite in un unico confronto.

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.

Convalida prima dell’adozione

Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.

  1. 1

    Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.

  2. 2

    Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.

  3. 3

    Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.

  4. 4

    Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.

Directory e valutazioni degli Agent