Configuración de Agent · τ²-bench Core

τ² standard agent · Gemini 3 Flash Preview · high

El objeto clasificado: modelo, andamiaje, herramientas, permisos, presupuesto y entorno en conjunto.

Promedio de tareas superadas¹83.49%
Coste por tarea completada con éxitoNo publicado
Intervalo de resultados publicadosNo publicado

01

Configuración

Sistema Agentτ² standard agent · Gemini 3 Flash Preview · high
Modelo baseGemini 3 Flash Preview
ID o etiqueta del modelo en la fuenteGemini 3 Flash Preview · high
Andamiajeτ² standard agent
Versión del andamiajev1.0.1
HerramientasStandard retail, airline, and telecom domain tools
EntornoAgente estándar y herramientas de dominio con un simulador de usuario compartido GPT-5.2 de razonamiento bajo
Presupuesto4 pruebas por tarea · 1.112 trayectorias por configuración

02

Resultado

Promedio de tareas superadas¹83.49%
Puntuación parcialNo publicado
Coste por tarea completada con éxitoNo publicado
Coste comunicado de la prueba de referenciaNo comunicado
Mediana del tiempo de finalizaciónNo publicado
Intervención humanaNo publicado

03

Operación

Pruebas de ejecuciones repetidas4 ejecuciones
Intervalo de resultados publicadosNo publicado
Nota de seguridadNo publicado
Grupo de comparabilidadtau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
Fecha de evaluación
Datos capturados

04

Confianza

EvidenciaIncluido por el editor del benchmark
FuenteSierra Research · τ²-bench
Instantánea de la fuentev1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
Fecha de los datos de la fuente
Recuperado por OpenGPT
Último cambio de la clasificaciónAún no hay un historial comparable
Última comprobación
Tareas278 tareas base de comercio minorista, aerolíneas y telecomunicaciones
Nivel de evidenciaMantenido por el editor
Nota sobre la evidencia

Solo se incluyen las ocho filas enviadas por el editor que comparten la prueba de referencia v1.0.1, la estructura y las herramientas estándar, el simulador de usuario, las divisiones de tareas base y el protocolo de cuatro ensayos. Las demás filas de τ-bench quedan fuera de este alcance.

Abrir auditoría

Qué no demuestra este resultado

Este resultado se aplica al sistema exacto y a las condiciones de la fuente que se muestran aquí. No establece que exista un Agent universalmente superior ni demuestra fiabilidad en producción, gobernanza de datos o rendimiento con una versión diferente del benchmark.

Comparar elementos equivalentes

Solo pueden incluirse en una misma comparación configuraciones de la misma versión de la prueba de referencia y con el mismo alcance de tareas.

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.

Validar antes de adoptar

Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.

  1. 1

    Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.

  2. 2

    Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.

  3. 3

    Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.

  4. 4

    Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.

Directorio y evaluaciones de Agents