Configurazione dell’Agent · OSWorld 2.0

OSWorld Agent · Claude Sonnet 4.6 · Max · Standard

L’oggetto classificato: modello, scaffold, strumenti, autorizzazioni, budget e ambiente nel loro insieme.

Completamento binario8.3%
Costo per attività riuscitaNon pubblicato
Intervallo dei risultati pubblicatiNon pubblicato

01

Configurazione

Sistema AgentOSWorld Agent · Claude Sonnet 4.6 · Max · Standard
Modello di baseClaude Sonnet 4.6
ID o etichetta del modello della fonteClaude Sonnet 4.6
ScaffoldOSWorld 2.0 computer-use agent
Versione dello scaffoldOSWorld 2.0
StrumentiStandard computer-use tool
AmbienteFlussi di lavoro desktop e del sistema operativo in macchine virtuali riproducibili
Budget500 passaggi

02

Esito

Completamento binario8.3%
Punteggio parziale41.5%
Costo per attività riuscitaNon pubblicato
Costo di benchmark indicato2410 USD
Tempo mediano di completamentoNon pubblicato
Intervento umanoNon pubblicato

03

Operazione

Evidenze delle esecuzioni ripetuteNon pubblicato
Intervallo dei risultati pubblicatiNon pubblicato
Nota sulla sicurezzaNon pubblicato
Gruppo di comparabilitàosworld-2-v2026-06-24-500
Data della valutazione
Dati acquisiti

04

Attendibilità

EvidenzeElencato dal publisher del benchmark
FonteOSWorld 2.0
Istantanea della fonteVersione dell’attività v2026.06.24 · budget di 500 passaggi
Data dei dati della fonte
Recuperato da OpenGPT
Ultima modifica della classificaAncora nessuna cronologia comparabile
Ultimo controllo
Attività108 flussi di lavoro informatici a lungo termine
Livello delle evidenzeAvvertenza esterna
Nota sulle evidenze

Le righe conservano l’agente, il modello, la modalità degli strumenti, la versione dell’attività, il limite di passaggi e le metriche della fonte riportati.

Apri l’audit

Cosa non dimostra questo risultato

Questo risultato si applica alle condizioni esatte del sistema e della fonte qui indicate. Non stabilisce quale sia il miglior agente in assoluto, né l’affidabilità in produzione, la governance dei dati o le prestazioni su una versione diversa del benchmark.

Confronta elementi omogenei

Soltanto configurazioni della stessa versione del benchmark e dello stesso ambito di attività possono essere inserite in un unico confronto.

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.

Convalida prima dell’adozione

Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.

  1. 1

    Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.

  2. 2

    Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.

  3. 3

    Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.

  4. 4

    Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.

Directory e valutazioni degli Agent