Benchmarks de Agents
Benchmark de agentes de AssistantBench
OpenGPT mantiene 15 filas publicadas asociadas a la versión AssistantBench exacta de la prueba de referencia y al entorno que se muestran a continuación.
- Tareas
- 33
- Filas publicadas
- 15
- Fecha de los datos de la fuente
- Identidad revisada
- Histórico
Alcance de la evidencia
HAL verified snapshot · 33 public tasks · 1 scaffold. public, automatically verifiable browsing tasks. Live-web research and browsing tasks reproduced por the Holistic Agent Leaderboard. Source-specific; no normalized step or token limit published.
How OpenGPT handles this evidence
OpenGPT conserva la métrica, el alcance de tareas, el entorno, la versión, los campos de configuración y la fecha de la fuente del editor. No crea una puntuación general de agentes entre pruebas de referencia distintas.
Límites de la comparación
- Un resultado superior solo se aplica a la versión y las condiciones del benchmark mostradas.
- Los resultados de Agents reflejan el sistema completo, no solo el modelo base.
- Los datos ausentes sobre coste, fiabilidad, seguridad o latencia se mantienen sin informar, en lugar de inferirse.
- HAL reprodujo estas filas y publica trazas, costes y números de ejecuciones. La clasificación es una instantánea histórica: HAL ha dejado en pausa la incorporación de nuevos modelos y los costes publicados no descuentan las ventajas del almacenamiento en caché.
Instantánea verificada de HAL · 33 tareas públicas · 1 entorno
Mostrando 15 de 15 filas publicadas. Cada resultado permanece vinculado al benchmark y a la configuración de origen.
- Browser-Use · o3 Medium (April 2025)Browser Use · o3 Medium (April 2025)#1Accuracy: 38.81%Browser-Use
- Browser-Use · GPT-5 Medium (August 2025)Browser Use · GPT-5 Medium (August 2025)#2Accuracy: 35.23%Browser-Use
- Browser-Use · o4-mini Low (April 2025)Browser Use · o4-mini Low (April 2025)#3Accuracy: 28.05%Browser-Use
- Browser-Use · o4-mini High (April 2025)Browser Use · o4-mini High (April 2025)#4Accuracy: 23.84%Browser-Use
- Browser-Use · GPT-4.1 (April 2025)Browser Use · GPT-4.1 (April 2025)#5Accuracy: 17.39%Browser-Use
- Browser-Use · Claude-3.7 Sonnet (February 2025)Browser Use · Claude-3.7 Sonnet (February 2025)#6Accuracy: 16.69%Browser-Use
- Browser-Use · Claude Opus 4.1 High (August 2025)Browser Use · Claude Opus 4.1 High (August 2025)#7Accuracy: 13.75%Browser-Use
- Browser-Use · Claude-3.7 Sonnet High (February 2025)Browser Use · Claude-3.7 Sonnet High (February 2025)#8Accuracy: 13.08%Browser-Use
- Browser-Use · Claude Sonnet 4.5 High (September 2025)Browser Use · Claude Sonnet 4.5 High (September 2025)#9Accuracy: 11.80%Browser-Use
- Browser-Use · DeepSeek R1 (May 2025)Browser Use · DeepSeek R1 (May 2025)#10Accuracy: 8.75%Browser-Use
- Browser-Use · Claude Opus 4.1 (August 2025)Browser Use · Claude Opus 4.1 (August 2025)#11Accuracy: 7.26%Browser-Use
- Browser-Use · Claude Sonnet 4.5 (September 2025)Browser Use · Claude Sonnet 4.5 (September 2025)#12Accuracy: 7.09%Browser-Use
- Browser-Use · Gemini 2.0 Flash (February 2025)Browser Use · Gemini 2.0 Flash (February 2025)#13Accuracy: 2.62%Browser-Use
- Browser-Use · DeepSeek V3 (March 2025)Browser Use · DeepSeek V3 (March 2025)#14Accuracy: 2.03%Browser-Use
- Browser-Use · DeepSeek R1 (January 2025)Browser Use · DeepSeek R1 (January 2025)#15Accuracy: 0.00%Browser-Use