Ambito condiviso del benchmark · OSWorld 2.0

Confronto tra agenti sullo stesso benchmark

Le voci seguenti condividono lo stesso ambito del benchmark. Rimangono visibili gli scaffold esatti, le versioni dei modelli, le date e i valori originali delle fonti.

Un valore di origine più elevato indica soltanto prestazioni migliori per questo benchmark e questa configurazione. Non è un punteggio confrontabile tra benchmark né un indicatore di idoneità alla produzione.

Confronta elementi omogenei

Panoramica della decisione

Soltanto configurazioni della stessa versione del benchmark e dello stesso ambito di attività possono essere inserite in un unico confronto.

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.
OpenAIOSWorld Agent · GPT-5.5 · Xhigh · Batch tool
Completamento binario13.0%Costo per attività riuscitaNon pubblicatoIntervallo dei risultati pubblicatiNon pubblicato
Dettagli dell’Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Completamento binario20.6%Costo per attività riuscitaNon pubblicatoIntervallo dei risultati pubblicatiNon pubblicato
Dettagli dell’Agent
15 campi identici o completamente privi di dati nascosti
Sistema AgentOSWorld Agent · GPT-5.5 · Xhigh · Batch toolOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configurazione
Modello di baseGPT-5.5Claude Opus 4.8
ID o etichetta del modello della fonteGPT-5.5Claude Opus 4.8
StrumentiStrumento di uso del computer in batchStrumento di uso del computer raggruppato in batch
Esito
Completamento binario13.0%20.6%
Punteggio parziale49.5%54.8%
Costo di benchmark indicato2750 USDNon pubblicato
Fonte
Apri la fonteApri la fonteApri la fonte

Configurazione

OSWorld Agent · GPT-5.5 · Xhigh · Batch tool

Modello di base
GPT-5.5
ID o etichetta del modello della fonte
GPT-5.5
Strumenti
Strumento di uso del computer in batch

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modello di base
Claude Opus 4.8
ID o etichetta del modello della fonte
Claude Opus 4.8
Strumenti
Strumento di uso del computer raggruppato in batch

Esito

OSWorld Agent · GPT-5.5 · Xhigh · Batch tool

Completamento binario
13.0%
Punteggio parziale
49.5%
Costo di benchmark indicato
2750 USD

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Completamento binario
20.6%
Punteggio parziale
54.8%
Costo di benchmark indicato
Non pubblicato

Fonte

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.

Convalida prima dell’adozione

Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.

  1. 1

    Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.

  2. 2

    Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.

  3. 3

    Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.

  4. 4

    Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.

Directory e valutazioni degli Agent