Configuration de l’Agent · τ³-Banking Knowledge

τ³ Banking AllTools · Grok 4.2 · high

L’objet classé : modèle, échafaudage, outils, autorisations, budget et environnement réunis.

Réussite¹18.04%
Coût par tâche réussieNon publié
Plage des résultats publiésNon publié

01

Configuration

Système Agentτ³ Banking AllTools · Grok 4.2 · high
Modèle de baseGrok 4.2
ID ou libellé du modèle sourceGrok 4.2 · high
Échafaudageτ³ standard agent
Version de l’échafaudagev1.0.1
OutilsAllTools: BM25, text-embedding-3-large retrieval, and sandboxed shell
EnvironnementÉchafaudage standard avec BM25, recherche par plongements vectoriels et recherche en ligne de commande dans un bac à sable
Budget4 essais par tâche · 388 trajectoires par configuration

02

Résultat obtenu

Réussite¹18.04%
Score partielNon publié
Coût par tâche réussieNon publié
Coût de benchmark déclaréNon renseigné
Durée médiane d’achèvementNon publié
Intervention humaineNon publié

03

Opération

Preuves issues d’exécutions répétées4 exécutions
Plage des résultats publiésNon publié
Note de sécuritéNon publié
Groupe de comparabilitétau3-banking-v1-0-1-alltools-gpt-5-2-low-seed-300-4-trials
Date de l’évaluation
Données saisies

04

Confiance

PreuvesRépertorié par l’éditeur du benchmark
SourceSierra Research · τ³-Banking
Instantané de la sourcev1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials
Date des données sources
Récupéré par OpenGPT
Dernière modification du classement
Dernière vérification
Tâches97 tâches de connaissances bancaires
Niveau de preuveMaintenu par l’éditeur
Note sur les preuves

Les lignes incluses partagent le benchmark v1.0.1, le segment Banking Knowledge de 97 tâches, la configuration AllTools, le simulateur d’utilisateur, la graine et le protocole à quatre essais. Les coûts manquants restent inconnus.

Ouvrir l’audit

Ce que ce résultat ne prouve pas

Ce résultat s’applique au système exact et aux conditions de source indiquées ici. Il n’établit ni le meilleur agent universel, ni la fiabilité en production, ni la gouvernance des données, ni les performances sur une autre version du benchmark.

Comparer ce qui est comparable

Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.

Données déclarées par la source ; les valeurs manquantes restent inconnues.

Valider avant l’adoption

Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.

  1. 1

    Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.

  2. 2

    Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.

  3. 3

    Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.

  4. 4

    Examinez les échecs et les risques liés au traitement des données avant toute décision de production.

Annuaire et évaluations des Agents