Ambito condiviso del benchmark · OSWorld 2.0

Confronto tra agenti sullo stesso benchmark

Le voci seguenti condividono lo stesso ambito del benchmark. Rimangono visibili gli scaffold esatti, le versioni dei modelli, le date e i valori originali delle fonti.

Un valore di origine più elevato indica soltanto prestazioni migliori per questo benchmark e questa configurazione. Non è un punteggio confrontabile tra benchmark né un indicatore di idoneità alla produzione.

Confronta elementi omogenei

Panoramica della decisione

Soltanto configurazioni della stessa versione del benchmark e dello stesso ambito di attività possono essere inserite in un unico confronto.

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.
AnthropicOSWorld Agent · Claude Sonnet 4.6 · Medium · Standard
Completamento binario9.3%Costo per attività riuscitaNon pubblicatoIntervallo dei risultati pubblicatiNon pubblicato
Dettagli dell’Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Completamento binario20.6%Costo per attività riuscitaNon pubblicatoIntervallo dei risultati pubblicatiNon pubblicato
Dettagli dell’Agent
15 campi identici o completamente privi di dati nascosti
Sistema AgentOSWorld Agent · Claude Sonnet 4.6 · Medium · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configurazione
Modello di baseClaude Sonnet 4.6Claude Opus 4.8
ID o etichetta del modello della fonteClaude Sonnet 4.6Claude Opus 4.8
StrumentiStrumento standard per l’uso del computerStrumento di uso del computer raggruppato in batch
Esito
Completamento binario9.3%20.6%
Punteggio parziale33.9%54.8%
Costo di benchmark indicato1550 USDNon pubblicato
Fonte
Apri la fonteApri la fonteApri la fonte

Configurazione

OSWorld Agent · Claude Sonnet 4.6 · Medium · Standard

Modello di base
Claude Sonnet 4.6
ID o etichetta del modello della fonte
Claude Sonnet 4.6
Strumenti
Strumento standard per l’uso del computer

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modello di base
Claude Opus 4.8
ID o etichetta del modello della fonte
Claude Opus 4.8
Strumenti
Strumento di uso del computer raggruppato in batch

Esito

OSWorld Agent · Claude Sonnet 4.6 · Medium · Standard

Completamento binario
9.3%
Punteggio parziale
33.9%
Costo di benchmark indicato
1550 USD

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Completamento binario
20.6%
Punteggio parziale
54.8%
Costo di benchmark indicato
Non pubblicato

Fonte

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.

Convalida prima dell’adozione

Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.

  1. 1

    Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.

  2. 2

    Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.

  3. 3

    Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.

  4. 4

    Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.

Directory e valutazioni degli Agent