Gedeeld benchmarkbereik · OSWorld 2.0
Agentvergelijking binnen dezelfde benchmark
De onderstaande items delen hetzelfde benchmarkbereik. Hun exacte scaffolds, modelversies, datums en oorspronkelijke bronwaarden blijven zichtbaar.
Een hogere bronwaarde duidt uitsluitend op betere prestaties binnen deze benchmark en configuratie. Het is geen score die vergelijking tussen verschillende benchmarks mogelijk maakt van die iets zegt over de geschiktheid voor productiegebruik.
Vergelijk vergelijkbare zaken
Beslissingsoverzicht
Alleen configuraties uit dezelfde benchmarkversie en hetzelfde taakbereik kunnen in één vergelijking worden geplaatst.
| Agentsysteem | OSWorld Agent · Kimi 2.6 · Enabled · Standard | OSWorld Agent · Claude Opus 4.8 · Max · Batched tool |
|---|---|---|
| Configuratie | ||
| Basismodel | Kimi 2.6 | Claude Opus 4.8 |
| Model-ID van label uit bron | Kimi 2.6 | Claude Opus 4.8 |
| Hulpmiddelen | Standaardhulpmiddel voor computergebruik | Gebatchte tool voor computergebruik |
| Resultaat | ||
| Binaire voltooiing | 4.6% | 20.6% |
| Gedeeltelijke score | 22.1% | 54.8% |
| Gerapporteerde benchmarkkosten | US$ 708 | Niet gepubliceerd |
| Bron | ||
| Bron openen | Bron openen ↗ | Bron openen ↗ |
Configuratie
OSWorld Agent · Kimi 2.6 · Enabled · Standard
- Basismodel
- Kimi 2.6
- Model-ID van label uit bron
- Kimi 2.6
- Hulpmiddelen
- Standaardhulpmiddel voor computergebruik
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Basismodel
- Claude Opus 4.8
- Model-ID van label uit bron
- Claude Opus 4.8
- Hulpmiddelen
- Gebatchte tool voor computergebruik
Resultaat
OSWorld Agent · Kimi 2.6 · Enabled · Standard
- Binaire voltooiing
- 4.6%
- Gedeeltelijke score
- 22.1%
- Gerapporteerde benchmarkkosten
- US$ 708
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Binaire voltooiing
- 20.6%
- Gedeeltelijke score
- 54.8%
- Gerapporteerde benchmarkkosten
- Niet gepubliceerd
Bron
OSWorld Agent · Kimi 2.6 · Enabled · Standard
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.
Valideren vóór ingebruikname
Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt van de configuratie bij uw werk past.
- 1
Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.
- 2
Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.
- 3
Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.
- 4
Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.