Benchmarks de Agents

Benchmark de agentes de τ²-bench Core

OpenGPT mantiene 8 filas publicadas asociadas a la versión τ²-bench Core exacta de la prueba de referencia y al entorno que se muestran a continuación.

Tareas
278
Filas publicadas
8
Fecha de los datos de la fuente
Identidad revisada
Actual

Alcance de la evidencia

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials. base tasks across retail, airline, and telecom. Standard agent, standard domain tools, and a shared GPT-5.2 low-reasoning user simulator. 4 trials per task · 1,112 trajectories per configuration.

How OpenGPT handles this evidence

OpenGPT conserva la métrica, el alcance de tareas, el entorno, la versión, los campos de configuración y la fecha de la fuente del editor. No crea una puntuación general de agentes entre pruebas de referencia distintas.

Límites de la comparación

  • Un resultado superior solo se aplica a la versión y las condiciones del benchmark mostradas.
  • Los resultados de Agents reflejan el sistema completo, no solo el modelo base.
  • Los datos ausentes sobre coste, fiabilidad, seguridad o latencia se mantienen sin informar, en lugar de inferirse.
  • OpenGPT incluye solo las ocho filas enviadas por el editor que comparten la prueba de referencia v1.0.1, la estructura y las herramientas estándar, el mismo simulador de usuario, las mismas divisiones de tareas base y cuatro ensayos. Las demás filas de τ-bench quedan fuera de este alcance.

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials

Mostrando 8 de 8 filas publicadas. Cada resultado permanece vinculado al benchmark y a la configuración de origen.

  1. τ² standard agent · Qwen3.5-397B-A17B · thinkingAlibaba Cloud · Qwen3.5-397B-A17B#1Average Pass¹: 87.91%τ² standard agent
  2. τ² standard agent · Claude Opus 4.5 · altoAnthropic · Claude Opus 4.5#2Average Pass¹: 85.31%τ² standard agent
  3. τ² standard agent · GPT-5.2 · altoOpenAI · GPT-5.2#3Average Pass¹: 84.76%τ² standard agent
  4. τ² standard agent · Gemini 3 Flash Preview · altoGoogle · Gemini 3 Flash Preview#4Average Pass¹: 83.49%τ² standard agent
  5. τ² standard agent · Gemini 3 Pro Preview · altoGoogle · Gemini 3 Pro Preview#5Average Pass¹: 82.46%τ² standard agent
  6. τ² standard agent · GLM-5 · thinkingZhipu AI · GLM-5#6Average Pass¹: 81.01%τ² standard agent
  7. τ² standard agent · Claude Sonnet 4.5 · razonamiento ampliadoAnthropic · Claude Sonnet 4.5#7Average Pass¹: 76.41%τ² standard agent
  8. τ² standard agent · GPT-5.2 · sin razonamientoOpenAI · GPT-5.2#8Average Pass¹: 61.58%τ² standard agent