Gedeeld benchmarkbereik · OSWorld 2.0

Agentvergelijking binnen dezelfde benchmark

De onderstaande items delen hetzelfde benchmarkbereik. Hun exacte scaffolds, modelversies, datums en oorspronkelijke bronwaarden blijven zichtbaar.

Een hogere bronwaarde duidt uitsluitend op betere prestaties binnen deze benchmark en configuratie. Het is geen score die vergelijking tussen verschillende benchmarks mogelijk maakt van die iets zegt over de geschiktheid voor productiegebruik.

Vergelijk vergelijkbare zaken

Beslissingsoverzicht

Alleen configuraties uit dezelfde benchmarkversie en hetzelfde taakbereik kunnen in één vergelijking worden geplaatst.

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.
Alibaba QwenOSWorld Agent · Qwen 3.7-Plus · Thinking · Standard
Binaire voltooiing2.8%Kosten per geslaagde taakNiet gepubliceerdBereik van gepubliceerde resultatenNiet gepubliceerd
Agentdetails
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Binaire voltooiing20.6%Kosten per geslaagde taakNiet gepubliceerdBereik van gepubliceerde resultatenNiet gepubliceerd
Agentdetails
15 identieke van volledig niet-gerapporteerde velden verborgen
AgentsysteemOSWorld Agent · Qwen 3.7-Plus · Thinking · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuratie
BasismodelQwen 3.7-PlusClaude Opus 4.8
Model-ID van label uit bronQwen 3.7-PlusClaude Opus 4.8
HulpmiddelenStandaardhulpmiddel voor computergebruikGebatchte tool voor computergebruik
Resultaat
Binaire voltooiing2.8%20.6%
Gedeeltelijke score21.5%54.8%
Gerapporteerde benchmarkkostenUS$ 411,56Niet gepubliceerd
Bron
Bron openenBron openenBron openen

Configuratie

OSWorld Agent · Qwen 3.7-Plus · Thinking · Standard

Basismodel
Qwen 3.7-Plus
Model-ID van label uit bron
Qwen 3.7-Plus
Hulpmiddelen
Standaardhulpmiddel voor computergebruik

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Basismodel
Claude Opus 4.8
Model-ID van label uit bron
Claude Opus 4.8
Hulpmiddelen
Gebatchte tool voor computergebruik

Resultaat

OSWorld Agent · Qwen 3.7-Plus · Thinking · Standard

Binaire voltooiing
2.8%
Gedeeltelijke score
21.5%
Gerapporteerde benchmarkkosten
US$ 411,56

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Binaire voltooiing
20.6%
Gedeeltelijke score
54.8%
Gerapporteerde benchmarkkosten
Niet gepubliceerd

Bron

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.

Valideren vóór ingebruikname

Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt van de configuratie bij uw werk past.

  1. 1

    Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.

  2. 2

    Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.

  3. 3

    Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.

  4. 4

    Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.

Agentoverzicht en -evaluaties