Configuration de l’Agent · AssistantBench
Browser-Use · Claude Sonnet 4.5 High (September 2025)
L’objet classé : modèle, échafaudage, outils, autorisations, budget et environnement réunis.
01
Configuration
02
Résultat obtenu
03
Opération
04
Confiance
Note sur les preuves
HAL a reproduit ces lignes publiques et publie les traces, les coûts et le nombre d’exécutions. Considérez cet instantané comme historique : HAL a suspendu l’ajout de nouveaux modèles et les coûts indiqués excluent les gains liés à la mise en cache.
Ouvrir l’audit ↗Ce que ce résultat ne prouve pas
Ce résultat s’applique au système exact et aux conditions de source indiquées ici. Il n’établit ni le meilleur agent universel, ni la fiabilité en production, ni la gouvernance des données, ni les performances sur une autre version du benchmark.
Données déclarées par la source ; les valeurs manquantes restent inconnues.
Valider avant l’adoption
Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.
- 1
Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.
- 2
Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.
- 3
Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.
- 4
Examinez les échecs et les risques liés au traitement des données avant toute décision de production.