Périmètre de benchmark partagé · OSWorld 2.0

Comparaison d’agents au sein du même benchmark

Les entrées ci-dessous relèvent du même périmètre de benchmark. Leurs échafaudages, versions de modèles, dates et valeurs sources d’origine exacts restent visibles.

Une valeur source plus élevée indique uniquement de meilleures performances pour ce benchmark et cette configuration. Il ne s’agit ni d’un score comparable entre benchmarks ni d’un indicateur d’aptitude à la production.

Comparer ce qui est comparable

Vue d’ensemble de la décision

Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.

Données déclarées par la source ; les valeurs manquantes restent inconnues.
MiniMaxOSWorld Agent · MiniMax M3 · Enabled · Standard
Achèvement binaire4.6%Coût par tâche réussieNon publiéPlage des résultats publiésNon publié
Détails de l’Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Achèvement binaire20.6%Coût par tâche réussieNon publiéPlage des résultats publiésNon publié
Détails de l’Agent
15 champs identiques ou entièrement non renseignés masqués
Système AgentOSWorld Agent · MiniMax M3 · Enabled · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuration
Modèle de baseMiniMax M3Claude Opus 4.8
ID ou libellé du modèle sourceMiniMax M3Claude Opus 4.8
OutilsOutil standard d’utilisation d’ordinateurOutil d’utilisation d’ordinateur en lots
Résultat obtenu
Achèvement binaire4.6%20.6%
Score partiel22.3%54.8%
Coût de benchmark déclaré258,78 $USNon publié
Source
Ouvrir la sourceOuvrir la sourceOuvrir la source

Configuration

OSWorld Agent · MiniMax M3 · Enabled · Standard

Modèle de base
MiniMax M3
ID ou libellé du modèle source
MiniMax M3
Outils
Outil standard d’utilisation d’ordinateur

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modèle de base
Claude Opus 4.8
ID ou libellé du modèle source
Claude Opus 4.8
Outils
Outil d’utilisation d’ordinateur en lots

Résultat obtenu

OSWorld Agent · MiniMax M3 · Enabled · Standard

Achèvement binaire
4.6%
Score partiel
22.3%
Coût de benchmark déclaré
258,78 $US

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Achèvement binaire
20.6%
Score partiel
54.8%
Coût de benchmark déclaré
Non publié

Source

Données déclarées par la source ; les valeurs manquantes restent inconnues.

Valider avant l’adoption

Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.

  1. 1

    Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.

  2. 2

    Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.

  3. 3

    Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.

  4. 4

    Examinez les échecs et les risques liés au traitement des données avant toute décision de production.

Annuaire et évaluations des Agents