Configuración de Agent · AssistantBench

Browser-Use · Claude Sonnet 4.5 (September 2025)

El objeto clasificado: modelo, andamiaje, herramientas, permisos, presupuesto y entorno en conjunto.

Precisión7.09%
Coste por tarea completada con éxito32,31 US$
Intervalo de resultados publicadosNo publicado

01

Configuración

Sistema AgentBrowser-Use · Claude Sonnet 4.5 (September 2025)
Modelo baseClaude Sonnet 4.5 (September 2025)
ID o etiqueta del modelo en la fuenteClaude Sonnet 4.5 (September 2025)
AndamiajeBrowser-Use
Versión del andamiajeNo comunicado
HerramientasBrowser-Use live-web browser automation
EntornoTareas de investigación y navegación web en directo reproducidas por Holistic Agent Leaderboard
PresupuestoEspecífico de la fuente · no se publicó un límite normalizado de pasos ni de tokens

02

Resultado

Precisión7.09%
Puntuación parcialNo publicado
Coste por tarea completada con éxito32,31 US$
Coste comunicado de la prueba de referencia75,6 US$
Mediana del tiempo de finalizaciónNo publicado
Intervención humanaNo publicado

03

Operación

Pruebas de ejecuciones repetidas1 ejecuciones
Intervalo de resultados publicadosNo publicado
Nota de seguridadNo publicado
Grupo de comparabilidadhal-assistantbench-public-33-browser-use
Fecha de evaluaciónNo publicado
Datos capturados

04

Confianza

EvidenciaRegistro completo de ejecución pública
FuenteHolistic Agent Leaderboard · AssistantBench
Instantánea de la fuenteInstantánea verificada de HAL · 33 tareas públicas · 1 entorno
Fecha de los datos de la fuenteLa fuente no lo ha publicado
Recuperado por OpenGPT
Último cambio de la clasificaciónAún no hay un historial comparable
Última comprobación
Tareas33 tareas públicas de navegación verificables automáticamente
Nivel de evidenciaAdvertencia externa
Nota sobre la evidencia

HAL reprodujo estas filas públicas y publica trazas, costes y números de ejecuciones. Considera la instantánea como histórica: HAL ha dejado en pausa la incorporación de nuevos modelos y los costes publicados no descuentan las ventajas del almacenamiento en caché.

Abrir auditoría

Qué no demuestra este resultado

Este resultado se aplica al sistema exacto y a las condiciones de la fuente que se muestran aquí. No establece que exista un Agent universalmente superior ni demuestra fiabilidad en producción, gobernanza de datos o rendimiento con una versión diferente del benchmark.

Comparar elementos equivalentes

Solo pueden incluirse en una misma comparación configuraciones de la misma versión de la prueba de referencia y con el mismo alcance de tareas.

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.

Validar antes de adoptar

Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.

  1. 1

    Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.

  2. 2

    Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.

  3. 3

    Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.

  4. 4

    Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.

Directorio y evaluaciones de Agents