Agent-benchmarks

OSWorld 2.0 agent-benchmark

OpenGPT houdt 10 gepubliceerde rijen gekoppeld aan de exacte OSWorld 2.0-benchmarkversie en hieronder weergegeven omgeving.

Taken
108
Gepubliceerde rijen
10
Datum van brongegevens
Identiteit beoordeeld
Historisch

Bewijsbereik

task version v2026.06.24 · 500-step budget. long-horizon computer workflows. Desktop applications and operating-system workflows in reproducible VMs. 500 steps.

How OpenGPT handles this evidence

OpenGPT behoudt de meetwaarde, het taakbereik, de omgeving, versie, configuratievelden en brondatum van de uitgever. Het maakt geen algehele Agent-score over benchmarks heen.

Vergelijkingsgrenzen

  • Een hoger resultaat geldt alleen voor de weergegeven benchmarkversie en de bijbehorende voorwaarden.
  • Agentresultaten weerspiegelen het volledige systeem, niet alleen het basismodel.
  • Ontbrekende gegevens over kosten, betrouwbaarheid, veiligheid of latentie worden niet afgeleid maar blijven niet-gerapporteerd.
  • Rijen behouden het aan versie v2026.06.24 gebonden resultaat als Historisch bewijs. Ze worden niet opnieuw als Actueel gelabeld omdat de actieve benchmarkrelease v2026.08.08 de taaksemantiek wijzigt en er geen overeenkomende Actuele momentopname van resultaten beschikbaar is.

task version v2026.06.24 · 500-step budget

10 van 10 gepubliceerde rijen weergegeven. Elk resultaat blijft gekoppeld aan de bronbenchmark en configuratie.

  1. OSWorld Agent · Claude Opus 4.8 · Max · Batched toolAnthropic · Claude Opus 4.8#1Binary completion: 20.6%OSWorld 2.0-agent voor computergebruik
  2. OSWorld Agent · Claude Opus 4.8 · Max · StandardAnthropic · Claude Opus 4.8#2Binary completion: 18.52%OSWorld 2.0-agent voor computergebruik
  3. OSWorld Agent · Claude Opus 4.7 · Max · Batched toolAnthropic · Claude Opus 4.7#3Binary completion: 18.2%OSWorld 2.0-agent voor computergebruik
  4. OSWorld Agent · Claude Opus 4.7 · Max · StandardAnthropic · Claude Opus 4.7#4Binary completion: 13.9%OSWorld 2.0-agent voor computergebruik
  5. OSWorld Agent · GPT-5.5 · Xhigh · Batch toolOpenAI · GPT-5.5#5Binary completion: 13.0%OSWorld 2.0-agent voor computergebruik
  6. OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardAnthropic · Claude Sonnet 4.6#6Binary completion: 9.3%OSWorld 2.0-agent voor computergebruik
  7. OSWorld Agent · Claude Sonnet 4.6 · Max · StandardAnthropic · Claude Sonnet 4.6#7Binary completion: 8.3%OSWorld 2.0-agent voor computergebruik
  8. OSWorld Agent · MiniMax M3 · Enabled · StandardMiniMax · MiniMax M3#8Binary completion: 4.6%OSWorld 2.0-agent voor computergebruik
  9. OSWorld Agent · Kimi 2.6 · Enabled · StandardMoonshot AI · Kimi 2.6#8Binary completion: 4.6%OSWorld 2.0-agent voor computergebruik
  10. OSWorld Agent · Qwen 3.7-Plus · Thinking · StandardAlibaba Qwen · Qwen 3.7-Plus#10Binary completion: 2.8%OSWorld 2.0-agent voor computergebruik