Alcance compartido del benchmark · OSWorld 2.0
Comparación de agentes en el mismo benchmark
Las entradas que aparecen a continuación comparten el mismo alcance de benchmark. Sus andamiajes, versiones de modelos, fechas y valores originales de las fuentes permanecen visibles.
Un valor de origen superior solo significa un mejor rendimiento en este benchmark y esta configuración. No es una puntuación comparable entre benchmarks ni de preparación para producción.
Comparar elementos equivalentes
Resumen de la decisión
Solo pueden incluirse en una misma comparación configuraciones de la misma versión de la prueba de referencia y con el mismo alcance de tareas.
| Sistema Agent | OSWorld Agent · GPT-5.5 · Xhigh · Batch tool | OSWorld Agent · Claude Opus 4.8 · Max · Batched tool |
|---|---|---|
| Configuración | ||
| Modelo base | GPT-5.5 | Claude Opus 4.8 |
| ID o etiqueta del modelo en la fuente | GPT-5.5 | Claude Opus 4.8 |
| Herramientas | Herramienta de uso de ordenadores por lotes | Herramienta por lotes de uso de ordenadores |
| Resultado | ||
| Finalización binaria | 13.0% | 20.6% |
| Puntuación parcial | 49.5% | 54.8% |
| Coste comunicado de la prueba de referencia | 2750 US$ | No publicado |
| Fuente | ||
| Abrir fuente | Abrir fuente ↗ | Abrir fuente ↗ |
Configuración
OSWorld Agent · GPT-5.5 · Xhigh · Batch tool
- Modelo base
- GPT-5.5
- ID o etiqueta del modelo en la fuente
- GPT-5.5
- Herramientas
- Herramienta de uso de ordenadores por lotes
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Modelo base
- Claude Opus 4.8
- ID o etiqueta del modelo en la fuente
- Claude Opus 4.8
- Herramientas
- Herramienta por lotes de uso de ordenadores
Resultado
OSWorld Agent · GPT-5.5 · Xhigh · Batch tool
- Finalización binaria
- 13.0%
- Puntuación parcial
- 49.5%
- Coste comunicado de la prueba de referencia
- 2750 US$
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Finalización binaria
- 20.6%
- Puntuación parcial
- 54.8%
- Coste comunicado de la prueba de referencia
- No publicado
Fuente
OSWorld Agent · GPT-5.5 · Xhigh · Batch tool
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.
Validar antes de adoptar
Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.
- 1
Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.
- 2
Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.
- 3
Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.
- 4
Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.