Configuration de l’Agent · GAIA

HAL Generalist Agent · Claude Opus 4.1 High (August 2025)

L’objet classé : modèle, échafaudage, outils, autorisations, budget et environnement réunis.

Exactitude68.48%
Coût par tâche réussie4,98 $US
Plage des résultats publiésNon publié

01

Configuration

Système AgentHAL Generalist Agent · Claude Opus 4.1 High (August 2025)
Modèle de baseClaude Opus 4.1 High (August 2025)
ID ou libellé du modèle sourceClaude Opus 4.1 High (August 2025)
ÉchafaudageHAL Generalist Agent
Version de l’échafaudageNon renseigné
OutilsNon renseigné
EnvironnementTâches d’assistant généraliste exigeant du raisonnement, de la multimodalité, de la navigation et des outils
BudgetPropre à la source · aucune limite normalisée d’étapes ou de jetons publiée

02

Résultat obtenu

Exactitude68.48%
Score partielNon publié
Coût par tâche réussie4,98 $US
Coût de benchmark déclaré562,24 $US
Durée médiane d’achèvementNon publié
Intervention humaineNon publié

03

Opération

Preuves issues d’exécutions répétées1 exécutions
Plage des résultats publiésNon publié
Note de sécuritéNon publié
Groupe de comparabilitéhal-gaia-public-validation-165
Date de l’évaluationNon publié
Données saisies

04

Confiance

PreuvesFiche publique d’exécution complète
SourceHolistic Agent Leaderboard · GAIA
Instantané de la sourceInstantané HAL vérifié · jeu de validation public · 165 questions
Date des données sourcesNon publié par la source
Récupéré par OpenGPT
Dernière modification du classementAucun historique comparable pour l’instant
Dernière vérification
Tâches165 questions de validation publiques
Niveau de preuveAvertissement externe
Note sur les preuves

HAL a reproduit ces lignes de validation publique et publie l’échafaudage, le modèle, le score, le coût, le nombre d’exécutions et les traces. Considérez cet instantané comme historique ; aucun budget normalisé d’outils ou d’étapes n’est publié.

Ouvrir l’audit

Ce que ce résultat ne prouve pas

Ce résultat s’applique au système exact et aux conditions de source indiquées ici. Il n’établit ni le meilleur agent universel, ni la fiabilité en production, ni la gouvernance des données, ni les performances sur une autre version du benchmark.

Comparer ce qui est comparable

Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.

Données déclarées par la source ; les valeurs manquantes restent inconnues.

Valider avant l’adoption

Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.

  1. 1

    Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.

  2. 2

    Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.

  3. 3

    Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.

  4. 4

    Examinez les échecs et les risques liés au traitement des données avant toute décision de production.

Annuaire et évaluations des Agents