Gemeinsamer Benchmark-Umfang · OSWorld 2.0

Agentenvergleich innerhalb desselben Benchmarks

Die folgenden Einträge decken denselben Benchmark-Umfang ab. Ihre exakten Gerüste, Modellversionen, Daten und ursprünglichen Quellwerte bleiben sichtbar.

Ein höherer Ausgangswert bedeutet lediglich eine bessere Leistung bei diesem Benchmark und dieser Konfiguration. Es handelt sich nicht um einen Wert, der einen Vergleich über verschiedene Benchmarks hinweg ermöglicht oder Aufschluss über die Einsatzreife in der Produktion gibt.

Gleiches mit Gleichem vergleichen

Entscheidungsübersicht

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.
OpenAIOSWorld Agent · GPT-5.5 · Xhigh · Batch tool
Binäre Aufgabenerfüllung13.0%Kosten pro erfolgreich erledigter AufgabeNicht veröffentlichtVeröffentlichte ErgebnisspanneNicht veröffentlicht
Agentendetails
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Binäre Aufgabenerfüllung20.6%Kosten pro erfolgreich erledigter AufgabeNicht veröffentlichtVeröffentlichte ErgebnisspanneNicht veröffentlicht
Agentendetails
15 – Identische oder nicht gemeldete Felder ausgeblendet
AgentensystemOSWorld Agent · GPT-5.5 · Xhigh · Batch toolOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Konfiguration
BasismodellGPT-5.5Claude Opus 4.8
Quellmodell-ID oder -bezeichnungGPT-5.5Claude Opus 4.8
WerkzeugeComputer-Use-Tool für StapelverarbeitungComputer-Use-Tool mit Stapelverarbeitung
Ergebnis
Binäre Aufgabenerfüllung13.0%20.6%
Teilpunktzahl49.5%54.8%
Gemeldete Benchmark-Kosten2.750 $Nicht veröffentlicht
Quelle
Quelle öffnenQuelle öffnenQuelle öffnen

Konfiguration

OSWorld Agent · GPT-5.5 · Xhigh · Batch tool

Basismodell
GPT-5.5
Quellmodell-ID oder -bezeichnung
GPT-5.5
Werkzeuge
Computer-Use-Tool für Stapelverarbeitung

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Basismodell
Claude Opus 4.8
Quellmodell-ID oder -bezeichnung
Claude Opus 4.8
Werkzeuge
Computer-Use-Tool mit Stapelverarbeitung

Ergebnis

OSWorld Agent · GPT-5.5 · Xhigh · Batch tool

Binäre Aufgabenerfüllung
13.0%
Teilpunktzahl
49.5%
Gemeldete Benchmark-Kosten
2.750 $

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Binäre Aufgabenerfüllung
20.6%
Teilpunktzahl
54.8%
Gemeldete Benchmark-Kosten
Nicht veröffentlicht

Quelle

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen