Agenten-Benchmarks

OSWorld 2.0 Agenten-Benchmark

OpenGPT hält 10 veröffentlichte Zeilen mit der unten gezeigten exakten Benchmark-Version OSWorld 2.0 und Umgebung verknüpft.

Aufgaben
108
Veröffentlichte Zeilen
10
Datum der Quelldaten
Identität geprüft
Historisch

Nachweisumfang

task version v2026.06.24 · 500-step budget. long-horizon computer workflows. Desktop applications and operating-system workflows in reproducible VMs. 500 steps.

How OpenGPT handles this evidence

OpenGPT bewahrt Kennzahl, Aufgabenumfang, Umgebung, Version, Konfigurationsfelder und Quelldatum des Herausgebers. Es erstellt keine Benchmark-übergreifende Agent-Gesamtpunktzahl.

Vergleichsgrenzen

  • Ein höheres Ergebnis gilt nur für die angezeigte Benchmark-Version und die entsprechenden Bedingungen.
  • Die Ergebnisse der Agenten spiegeln das Gesamtsystem wider, nicht nur das Basismodell.
  • Fehlende Daten zu Kosten, Zuverlässigkeit, Sicherheit oder Latenz werden weiterhin als nicht gemeldet ausgewiesen und nicht abgeleitet.
  • Die Zeilen bewahren das an Version v2026.06.24 gebundene Ergebnis als historische Evidenz. Es wird nicht als aktuell neu gekennzeichnet, da die aktive Benchmark-Version v2026.08.08 die Aufgabensemantik ändert und kein passender aktueller Ergebnissnapshot verfügbar ist.

task version v2026.06.24 · 500-step budget

10 von 10 veröffentlichten Zeilen werden angezeigt. Jedes Ergebnis bleibt mit dem Quellbenchmark und der Konfiguration verknüpft.

  1. OSWorld Agent · Claude Opus 4.8 · Max · Batched toolAnthropic · Claude Opus 4.8#1Binary completion: 20.6%OSWorld 2.0 Agent für Computernutzung
  2. OSWorld Agent · Claude Opus 4.8 · Max · StandardAnthropic · Claude Opus 4.8#2Binary completion: 18.52%OSWorld 2.0 Agent für Computernutzung
  3. OSWorld Agent · Claude Opus 4.7 · Max · Batched toolAnthropic · Claude Opus 4.7#3Binary completion: 18.2%OSWorld 2.0 Agent für Computernutzung
  4. OSWorld Agent · Claude Opus 4.7 · Max · StandardAnthropic · Claude Opus 4.7#4Binary completion: 13.9%OSWorld 2.0 Agent für Computernutzung
  5. OSWorld Agent · GPT-5.5 · Xhigh · Batch toolOpenAI · GPT-5.5#5Binary completion: 13.0%OSWorld 2.0 Agent für Computernutzung
  6. OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardAnthropic · Claude Sonnet 4.6#6Binary completion: 9.3%OSWorld 2.0 Agent für Computernutzung
  7. OSWorld Agent · Claude Sonnet 4.6 · Max · StandardAnthropic · Claude Sonnet 4.6#7Binary completion: 8.3%OSWorld 2.0 Agent für Computernutzung
  8. OSWorld Agent · MiniMax M3 · Enabled · StandardMiniMax · MiniMax M3#8Binary completion: 4.6%OSWorld 2.0 Agent für Computernutzung
  9. OSWorld Agent · Kimi 2.6 · Enabled · StandardMoonshot AI · Kimi 2.6#8Binary completion: 4.6%OSWorld 2.0 Agent für Computernutzung
  10. OSWorld Agent · Qwen 3.7-Plus · Thinking · StandardAlibaba Qwen · Qwen 3.7-Plus#10Binary completion: 2.8%OSWorld 2.0 Agent für Computernutzung