Benchmarks d’Agents
Benchmark d’agents de OSWorld 2.0
OpenGPT conserve 10 lignes publiées, associées à la version OSWorld 2.0 exacte du benchmark et à l’environnement indiqués ci-dessous.
- Tâches
- 108
- Lignes publiées
- 10
- Date des données sources
- Identité examinée
- Historique
Périmètre des preuves
task version v2026.06.24 · 500-step budget. long-horizon computer workflows. Desktop applications and operating-system workflows dans reproducible VMs. 500 steps.
How OpenGPT handles this evidence
OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.
Limites de la comparaison
- Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
- Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
- Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
- Les lignes conservent comme preuve historique le résultat associé à la version v2026.06.24. Elles ne sont pas requalifiées comme actuelles, car la version active v2026.08.08 du benchmark modifie la sémantique des tâches et aucun instantané actuel correspondant n’est disponible.
task version v2026.06.24 · 500-step budget
Affichage de 10 lignes publiées sur 10. Chaque résultat reste associé au benchmark et à la configuration de sa source.
- OSWorld Agent · Claude Opus 4.8 · Max · Batched toolAnthropic · Claude Opus 4.8#1Binary completion: 20.6%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · Claude Opus 4.8 · Max · StandardAnthropic · Claude Opus 4.8#2Binary completion: 18.52%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · Claude Opus 4.7 · Max · Batched toolAnthropic · Claude Opus 4.7#3Binary completion: 18.2%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · Claude Opus 4.7 · Max · StandardAnthropic · Claude Opus 4.7#4Binary completion: 13.9%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · GPT-5.5 · Xhigh · Batch toolOpenAI · GPT-5.5#5Binary completion: 13.0%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardAnthropic · Claude Sonnet 4.6#6Binary completion: 9.3%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · Claude Sonnet 4.6 · Max · StandardAnthropic · Claude Sonnet 4.6#7Binary completion: 8.3%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · MiniMax M3 · Enabled · StandardMiniMax · MiniMax M3#8Binary completion: 4.6%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · Kimi 2.6 · Enabled · StandardMoonshot AI · Kimi 2.6#8Binary completion: 4.6%Agent d’utilisation d’ordinateur OSWorld 2.0
- OSWorld Agent · Qwen 3.7-Plus · Thinking · StandardAlibaba Qwen · Qwen 3.7-Plus#10Binary completion: 2.8%Agent d’utilisation d’ordinateur OSWorld 2.0