Périmètre de benchmark partagé · OSWorld 2.0
Comparaison d’agents au sein du même benchmark
Les entrées ci-dessous relèvent du même périmètre de benchmark. Leurs échafaudages, versions de modèles, dates et valeurs sources d’origine exacts restent visibles.
Une valeur source plus élevée indique uniquement de meilleures performances pour ce benchmark et cette configuration. Il ne s’agit ni d’un score comparable entre benchmarks ni d’un indicateur d’aptitude à la production.
Comparer ce qui est comparable
Vue d’ensemble de la décision
Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.
| Système Agent | OSWorld Agent · Kimi 2.6 · Enabled · Standard | OSWorld Agent · Claude Opus 4.8 · Max · Batched tool |
|---|---|---|
| Configuration | ||
| Modèle de base | Kimi 2.6 | Claude Opus 4.8 |
| ID ou libellé du modèle source | Kimi 2.6 | Claude Opus 4.8 |
| Outils | Outil standard d’utilisation d’ordinateur | Outil d’utilisation d’ordinateur en lots |
| Résultat obtenu | ||
| Achèvement binaire | 4.6% | 20.6% |
| Score partiel | 22.1% | 54.8% |
| Coût de benchmark déclaré | 708 $US | Non publié |
| Source | ||
| Ouvrir la source | Ouvrir la source ↗ | Ouvrir la source ↗ |
Configuration
OSWorld Agent · Kimi 2.6 · Enabled · Standard
- Modèle de base
- Kimi 2.6
- ID ou libellé du modèle source
- Kimi 2.6
- Outils
- Outil standard d’utilisation d’ordinateur
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Modèle de base
- Claude Opus 4.8
- ID ou libellé du modèle source
- Claude Opus 4.8
- Outils
- Outil d’utilisation d’ordinateur en lots
Résultat obtenu
OSWorld Agent · Kimi 2.6 · Enabled · Standard
- Achèvement binaire
- 4.6%
- Score partiel
- 22.1%
- Coût de benchmark déclaré
- 708 $US
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Achèvement binaire
- 20.6%
- Score partiel
- 54.8%
- Coût de benchmark déclaré
- Non publié
Source
OSWorld Agent · Kimi 2.6 · Enabled · Standard
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Données déclarées par la source ; les valeurs manquantes restent inconnues.
Valider avant l’adoption
Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.
- 1
Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.
- 2
Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.
- 3
Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.
- 4
Examinez les échecs et les risques liés au traitement des données avant toute décision de production.