Agent-benchmarks
OSWorld 2.0 agent-benchmark
OpenGPT houdt 10 gepubliceerde rijen gekoppeld aan de exacte OSWorld 2.0-benchmarkversie en hieronder weergegeven omgeving.
- Taken
- 108
- Gepubliceerde rijen
- 10
- Datum van brongegevens
- Identiteit beoordeeld
- Historisch
Bewijsbereik
task version v2026.06.24 · 500-step budget. long-horizon computer workflows. Desktop applications and operating-system workflows in reproducible VMs. 500 steps.
How OpenGPT handles this evidence
OpenGPT behoudt de meetwaarde, het taakbereik, de omgeving, versie, configuratievelden en brondatum van de uitgever. Het maakt geen algehele Agent-score over benchmarks heen.
Vergelijkingsgrenzen
- Een hoger resultaat geldt alleen voor de weergegeven benchmarkversie en de bijbehorende voorwaarden.
- Agentresultaten weerspiegelen het volledige systeem, niet alleen het basismodel.
- Ontbrekende gegevens over kosten, betrouwbaarheid, veiligheid of latentie worden niet afgeleid maar blijven niet-gerapporteerd.
- Rijen behouden het aan versie v2026.06.24 gebonden resultaat als Historisch bewijs. Ze worden niet opnieuw als Actueel gelabeld omdat de actieve benchmarkrelease v2026.08.08 de taaksemantiek wijzigt en er geen overeenkomende Actuele momentopname van resultaten beschikbaar is.
task version v2026.06.24 · 500-step budget
10 van 10 gepubliceerde rijen weergegeven. Elk resultaat blijft gekoppeld aan de bronbenchmark en configuratie.
- OSWorld Agent · Claude Opus 4.8 · Max · Batched toolAnthropic · Claude Opus 4.8#1Binary completion: 20.6%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · Claude Opus 4.8 · Max · StandardAnthropic · Claude Opus 4.8#2Binary completion: 18.52%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · Claude Opus 4.7 · Max · Batched toolAnthropic · Claude Opus 4.7#3Binary completion: 18.2%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · Claude Opus 4.7 · Max · StandardAnthropic · Claude Opus 4.7#4Binary completion: 13.9%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · GPT-5.5 · Xhigh · Batch toolOpenAI · GPT-5.5#5Binary completion: 13.0%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardAnthropic · Claude Sonnet 4.6#6Binary completion: 9.3%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · Claude Sonnet 4.6 · Max · StandardAnthropic · Claude Sonnet 4.6#7Binary completion: 8.3%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · MiniMax M3 · Enabled · StandardMiniMax · MiniMax M3#8Binary completion: 4.6%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · Kimi 2.6 · Enabled · StandardMoonshot AI · Kimi 2.6#8Binary completion: 4.6%OSWorld 2.0-agent voor computergebruik
- OSWorld Agent · Qwen 3.7-Plus · Thinking · StandardAlibaba Qwen · Qwen 3.7-Plus#10Binary completion: 2.8%OSWorld 2.0-agent voor computergebruik