Benchmarks d’Agents

Benchmark d’agents de τ²-bench Core

OpenGPT conserve 8 lignes publiées, associées à la version τ²-bench Core exacte du benchmark et à l’environnement indiqués ci-dessous.

Tâches
278
Lignes publiées
8
Date des données sources
Identité examinée
À jour

Périmètre des preuves

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials. base tasks across retail, airline, and telecom. Standard agent, standard domain tools, and a shared GPT-5.2 low-reasoning user simulator. 4 trials per task · 1,112 trajectories per configuration.

How OpenGPT handles this evidence

OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.

Limites de la comparaison

  • Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
  • Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
  • Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
  • OpenGPT inclut uniquement les huit lignes soumises par les éditeurs qui partagent le benchmark v1.0.1, l’échafaudage et les outils standard, le même simulateur d’utilisateur, les mêmes segments de tâches de base et quatre essais. Les autres lignes de τ-bench restent hors de ce périmètre.

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials

Affichage de 8 lignes publiées sur 8. Chaque résultat reste associé au benchmark et à la configuration de sa source.

  1. τ² standard agent · Qwen3.5-397B-A17B · thinkingAlibaba Cloud · Qwen3.5-397B-A17B#1Average Pass¹: 87.91%τ² standard agent
  2. τ² standard agent · Claude Opus 4.5 · élevéAnthropic · Claude Opus 4.5#2Average Pass¹: 85.31%τ² standard agent
  3. τ² standard agent · GPT-5.2 · élevéOpenAI · GPT-5.2#3Average Pass¹: 84.76%τ² standard agent
  4. τ² standard agent · Gemini 3 Flash Preview · élevéGoogle · Gemini 3 Flash Preview#4Average Pass¹: 83.49%τ² standard agent
  5. τ² standard agent · Gemini 3 Pro Preview · élevéGoogle · Gemini 3 Pro Preview#5Average Pass¹: 82.46%τ² standard agent
  6. τ² standard agent · GLM-5 · thinkingZhipu AI · GLM-5#6Average Pass¹: 81.01%τ² standard agent
  7. τ² standard agent · Claude Sonnet 4.5 · réflexion approfondieAnthropic · Claude Sonnet 4.5#7Average Pass¹: 76.41%τ² standard agent
  8. τ² standard agent · GPT-5.2 · sans raisonnementOpenAI · GPT-5.2#8Average Pass¹: 61.58%τ² standard agent