Alcance compartido del benchmark · τ²-bench Core

Comparación de agentes en el mismo benchmark

Las entradas que aparecen a continuación comparten el mismo alcance de benchmark. Sus andamiajes, versiones de modelos, fechas y valores originales de las fuentes permanecen visibles.

Un valor de origen superior solo significa un mejor rendimiento en este benchmark y esta configuración. No es una puntuación comparable entre benchmarks ni de preparación para producción.

Comparar elementos equivalentes

Resumen de la decisión

Solo pueden incluirse en una misma comparación configuraciones de la misma versión de la prueba de referencia y con el mismo alcance de tareas.

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.
Zhipu AIτ² standard agent · GLM-5 · thinking
Promedio de tareas superadas¹81.01%Coste por tarea completada con éxitoNo publicadoIntervalo de resultados publicadosNo publicado
Detalles del Agent
Alibaba Cloudτ² standard agent · Qwen3.5-397B-A17B · thinking
Promedio de tareas superadas¹87.91%Coste por tarea completada con éxitoNo publicadoIntervalo de resultados publicadosNo publicado
Detalles del Agent
18 campos idénticos o sin datos se ocultan
Sistema Agentτ² standard agent · GLM-5 · thinkingτ² standard agent · Qwen3.5-397B-A17B · thinking
Configuración
Modelo baseGLM-5Qwen3.5-397B-A17B
ID o etiqueta del modelo en la fuenteGLM-5 · thinkingQwen3.5-397B-A17B · thinking
Resultado
Promedio de tareas superadas¹81.01%87.91%
Fuente
Abrir fuenteAbrir fuenteAbrir fuente

Configuración

τ² standard agent · GLM-5 · thinking

Modelo base
GLM-5
ID o etiqueta del modelo en la fuente
GLM-5 · thinking

τ² standard agent · Qwen3.5-397B-A17B · thinking

Modelo base
Qwen3.5-397B-A17B
ID o etiqueta del modelo en la fuente
Qwen3.5-397B-A17B · thinking

Resultado

τ² standard agent · GLM-5 · thinking

Promedio de tareas superadas¹
81.01%

τ² standard agent · Qwen3.5-397B-A17B · thinking

Promedio de tareas superadas¹
87.91%

Fuente

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.

Validar antes de adoptar

Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.

  1. 1

    Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.

  2. 2

    Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.

  3. 3

    Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.

  4. 4

    Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.

Directorio y evaluaciones de Agents