Périmètre de benchmark partagé · OSWorld 2.0
Comparaison d’agents au sein du même benchmark
Les entrées ci-dessous relèvent du même périmètre de benchmark. Leurs échafaudages, versions de modèles, dates et valeurs sources d’origine exacts restent visibles.
Une valeur source plus élevée indique uniquement de meilleures performances pour ce benchmark et cette configuration. Il ne s’agit ni d’un score comparable entre benchmarks ni d’un indicateur d’aptitude à la production.
Comparer ce qui est comparable
Vue d’ensemble de la décision
Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.
| Système Agent | OSWorld Agent · MiniMax M3 · Enabled · Standard | OSWorld Agent · Claude Opus 4.8 · Max · Batched tool |
|---|---|---|
| Configuration | ||
| Modèle de base | MiniMax M3 | Claude Opus 4.8 |
| ID ou libellé du modèle source | MiniMax M3 | Claude Opus 4.8 |
| Outils | Outil standard d’utilisation d’ordinateur | Outil d’utilisation d’ordinateur en lots |
| Résultat obtenu | ||
| Achèvement binaire | 4.6% | 20.6% |
| Score partiel | 22.3% | 54.8% |
| Coût de benchmark déclaré | 258,78 $US | Non publié |
| Source | ||
| Ouvrir la source | Ouvrir la source ↗ | Ouvrir la source ↗ |
Configuration
OSWorld Agent · MiniMax M3 · Enabled · Standard
- Modèle de base
- MiniMax M3
- ID ou libellé du modèle source
- MiniMax M3
- Outils
- Outil standard d’utilisation d’ordinateur
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Modèle de base
- Claude Opus 4.8
- ID ou libellé du modèle source
- Claude Opus 4.8
- Outils
- Outil d’utilisation d’ordinateur en lots
Résultat obtenu
OSWorld Agent · MiniMax M3 · Enabled · Standard
- Achèvement binaire
- 4.6%
- Score partiel
- 22.3%
- Coût de benchmark déclaré
- 258,78 $US
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Achèvement binaire
- 20.6%
- Score partiel
- 54.8%
- Coût de benchmark déclaré
- Non publié
Source
OSWorld Agent · MiniMax M3 · Enabled · Standard
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Données déclarées par la source ; les valeurs manquantes restent inconnues.
Valider avant l’adoption
Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.
- 1
Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.
- 2
Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.
- 3
Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.
- 4
Examinez les échecs et les risques liés au traitement des données avant toute décision de production.