Configuration de l’Agent · τ²-bench Core

τ² standard agent · GPT-5.2 · high

L’objet classé : modèle, échafaudage, outils, autorisations, budget et environnement réunis.

Réussite moyenne¹84.76%
Coût par tâche réussieNon publié
Plage des résultats publiésNon publié

01

Configuration

Système Agentτ² standard agent · GPT-5.2 · high
Modèle de baseGPT-5.2
ID ou libellé du modèle sourceGPT-5.2 · high
Échafaudageτ² standard agent
Version de l’échafaudagev1.0.1
OutilsStandard retail, airline, and telecom domain tools
EnvironnementAgent standard et outils métier avec un simulateur d’utilisateur partagé GPT-5.2 à faible raisonnement
Budget4 essais par tâche · 1 112 trajectoires par configuration

02

Résultat obtenu

Réussite moyenne¹84.76%
Score partielNon publié
Coût par tâche réussieNon publié
Coût de benchmark déclaréNon renseigné
Durée médiane d’achèvementNon publié
Intervention humaineNon publié

03

Opération

Preuves issues d’exécutions répétées4 exécutions
Plage des résultats publiésNon publié
Note de sécuritéNon publié
Groupe de comparabilitétau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
Date de l’évaluation
Données saisies

04

Confiance

PreuvesRépertorié par l’éditeur du benchmark
SourceSierra Research · τ²-bench
Instantané de la sourcev1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
Date des données sources
Récupéré par OpenGPT
Dernière modification du classementAucun historique comparable pour l’instant
Dernière vérification
Tâches278 tâches de base dans le commerce de détail, le transport aérien et les télécommunications
Niveau de preuveMaintenu par l’éditeur
Note sur les preuves

Seules huit lignes soumises par les éditeurs, partageant le même benchmark v1.0.1, l’échafaudage et les outils standard, le simulateur d’utilisateur, les segments de tâches de base et le protocole à quatre essais, sont incluses. Les autres lignes de τ-bench restent hors de ce périmètre.

Ouvrir l’audit

Ce que ce résultat ne prouve pas

Ce résultat s’applique au système exact et aux conditions de source indiquées ici. Il n’établit ni le meilleur agent universel, ni la fiabilité en production, ni la gouvernance des données, ni les performances sur une autre version du benchmark.

Comparer ce qui est comparable

Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.

Données déclarées par la source ; les valeurs manquantes restent inconnues.

Valider avant l’adoption

Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.

  1. 1

    Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.

  2. 2

    Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.

  3. 3

    Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.

  4. 4

    Examinez les échecs et les risques liés au traitement des données avant toute décision de production.

Annuaire et évaluations des Agents