Benchmark degli Agent

Benchmark degli agenti di OSWorld 2.0

OpenGPT mantiene 10 righe pubblicate associate alla versione esatta del benchmark OSWorld 2.0 e all’ambiente mostrato sotto.

Attività
108
Righe pubblicate
10
Data dei dati della fonte
Identità esaminata
Storico

Ambito delle evidenze

task version v2026.06.24 · 500-step budget. long-horizon computer workflows. Desktop applications and operating-system workflows in reproducible VMs. 500 steps.

How OpenGPT handles this evidence

OpenGPT conserva la metrica, l’ambito delle attività, l’ambiente, la versione, i campi della configurazione e la data della fonte indicati dal publisher. Non crea un punteggio complessivo degli Agent tra benchmark diversi.

Limiti del confronto

  • Un risultato più elevato si applica solo alla versione del benchmark e alle condizioni visualizzate.
  • I risultati degli Agent riflettono il sistema completo, non soltanto il modello di base.
  • I dati mancanti su costi, affidabilità, sicurezza o latenza restano non indicati anziché essere dedotti.
  • Le righe conservano il risultato vincolato alla versione v2026.06.24 come evidenza storica. Non viene rietichettato come attuale perché la release attiva v2026.08.08 del benchmark modifica la semantica delle attività e non è disponibile un’istantanea corrispondente dei risultati attuali.

task version v2026.06.24 · 500-step budget

Visualizzate 10 di 10 righe pubblicate. Ogni risultato rimane associato al benchmark e alla configurazione della fonte.

  1. OSWorld Agent · Claude Opus 4.8 · Max · Batched toolAnthropic · Claude Opus 4.8#1Binary completion: 20.6%Agent OSWorld 2.0 per l’uso del computer
  2. OSWorld Agent · Claude Opus 4.8 · Max · StandardAnthropic · Claude Opus 4.8#2Binary completion: 18.52%Agent OSWorld 2.0 per l’uso del computer
  3. OSWorld Agent · Claude Opus 4.7 · Max · Batched toolAnthropic · Claude Opus 4.7#3Binary completion: 18.2%Agent OSWorld 2.0 per l’uso del computer
  4. OSWorld Agent · Claude Opus 4.7 · Max · StandardAnthropic · Claude Opus 4.7#4Binary completion: 13.9%Agent OSWorld 2.0 per l’uso del computer
  5. OSWorld Agent · GPT-5.5 · Xhigh · Batch toolOpenAI · GPT-5.5#5Binary completion: 13.0%Agent OSWorld 2.0 per l’uso del computer
  6. OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardAnthropic · Claude Sonnet 4.6#6Binary completion: 9.3%Agent OSWorld 2.0 per l’uso del computer
  7. OSWorld Agent · Claude Sonnet 4.6 · Max · StandardAnthropic · Claude Sonnet 4.6#7Binary completion: 8.3%Agent OSWorld 2.0 per l’uso del computer
  8. OSWorld Agent · MiniMax M3 · Enabled · StandardMiniMax · MiniMax M3#8Binary completion: 4.6%Agent OSWorld 2.0 per l’uso del computer
  9. OSWorld Agent · Kimi 2.6 · Enabled · StandardMoonshot AI · Kimi 2.6#8Binary completion: 4.6%Agent OSWorld 2.0 per l’uso del computer
  10. OSWorld Agent · Qwen 3.7-Plus · Thinking · StandardAlibaba Qwen · Qwen 3.7-Plus#10Binary completion: 2.8%Agent OSWorld 2.0 per l’uso del computer