Agentenkonfiguration · OSWorld 2.0

OSWorld Agent · Kimi 2.6 · Enabled · Standard

Das eingeordnete Objekt: Modell, Gerüst, Tools, Berechtigungen, Budget und Umgebung als Einheit.

Binäre Aufgabenerfüllung4.6%
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht

01

Konfiguration

AgentensystemOSWorld Agent · Kimi 2.6 · Enabled · Standard
BasismodellKimi 2.6
Quellmodell-ID oder -bezeichnungKimi 2.6
AgentengerüstOSWorld 2.0 computer-use agent
Scaffold-VersionOSWorld 2.0
WerkzeugeStandard computer-use tool
UmgebungDesktop- und Betriebssystemabläufe in reproduzierbaren virtuellen Maschinen
Budget500 Schritte

02

Ergebnis

Binäre Aufgabenerfüllung4.6%
Teilpunktzahl22.1%
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Gemeldete Benchmark-Kosten708 $
Mediane AbschlusszeitNicht veröffentlicht
Menschliches EingreifenNicht veröffentlicht

03

Vorgang

Evidenz aus wiederholten DurchläufenNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht
SicherheitshinweisNicht veröffentlicht
Vergleichbarkeitsgruppeosworld-2-v2026-06-24-500
Bewertungsdatum
Daten erfasst

04

Vertrauen

NachweisVom Benchmark-Herausgeber gelistet
QuelleOSWorld 2.0
QuellsnapshotAufgabenversion v2026.06.24 · Budget von 500 Schritten
Datum der Quelldaten
Von OpenGPT abgerufen
Letzte RankingänderungNoch kein vergleichbarer Verlauf
Zuletzt geprüft
Aufgaben108 langfristige Computer-Arbeitsabläufe
NachweisstufeExterner Warnhinweis
Nachweishinweis

Die Zeilen bewahren die gemeldeten Angaben zu Agent, Modell, Tool-Modus, Aufgabenversion, Schrittlimit und Quellmetriken.

Audit öffnen

Was dieses Ergebnis nicht nachweist

Dieses Ergebnis gilt für das hier gezeigte exakte System und die angegebenen Quellbedingungen. Es weist weder einen universell besten Agenten noch Produktionstauglichkeit, Daten-Governance oder Leistung mit einer anderen Benchmark-Version nach.

Gleiches mit Gleichem vergleichen

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen