Configuración de Agent · GAIA

HF Open Deep Research · o4-mini High (April 2025)

El objeto clasificado: modelo, andamiaje, herramientas, permisos, presupuesto y entorno en conjunto.

Precisión55.76%
Coste por tarea completada con éxito2,01 US$
Intervalo de resultados publicadosNo publicado

01

Configuración

Sistema AgentHF Open Deep Research · o4-mini High (April 2025)
Modelo baseo4-mini High (April 2025)
ID o etiqueta del modelo en la fuenteo4-mini High (April 2025)
AndamiajeHF Open Deep Research
Versión del andamiajeNo comunicado
HerramientasNo comunicado
EntornoTareas para asistentes generales que requieren razonamiento, multimodalidad, navegación y herramientas
PresupuestoEspecífico de la fuente · no se publicó un límite normalizado de pasos ni de tokens

02

Resultado

Precisión55.76%
Puntuación parcialNo publicado
Coste por tarea completada con éxito2,01 US$
Coste comunicado de la prueba de referencia184,87 US$
Mediana del tiempo de finalizaciónNo publicado
Intervención humanaNo publicado

03

Operación

Pruebas de ejecuciones repetidas1 ejecuciones
Intervalo de resultados publicadosNo publicado
Nota de seguridadNo publicado
Grupo de comparabilidadhal-gaia-public-validation-165
Fecha de evaluaciónNo publicado
Datos capturados

04

Confianza

EvidenciaRegistro completo de ejecución pública
FuenteHolistic Agent Leaderboard · GAIA
Instantánea de la fuenteInstantánea verificada de HAL · conjunto público de validación · 165 preguntas
Fecha de los datos de la fuenteLa fuente no lo ha publicado
Recuperado por OpenGPT
Último cambio de la clasificaciónAún no hay un historial comparable
Última comprobación
Tareas165 preguntas de validación pública
Nivel de evidenciaAdvertencia externa
Nota sobre la evidencia

HAL reprodujo estas filas de validación pública y publica el entorno, el modelo, la puntuación, el coste, el número de ejecuciones y las trazas. Considera la instantánea como histórica; no se publica ningún límite normalizado de herramientas o pasos.

Abrir auditoría

Qué no demuestra este resultado

Este resultado se aplica al sistema exacto y a las condiciones de la fuente que se muestran aquí. No establece que exista un Agent universalmente superior ni demuestra fiabilidad en producción, gobernanza de datos o rendimiento con una versión diferente del benchmark.

Comparar elementos equivalentes

Solo pueden incluirse en una misma comparación configuraciones de la misma versión de la prueba de referencia y con el mismo alcance de tareas.

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.

Validar antes de adoptar

Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.

  1. 1

    Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.

  2. 2

    Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.

  3. 3

    Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.

  4. 4

    Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.

Directorio y evaluaciones de Agents