Alcance compartido del benchmark · OSWorld 2.0

Comparación de agentes en el mismo benchmark

Las entradas que aparecen a continuación comparten el mismo alcance de benchmark. Sus andamiajes, versiones de modelos, fechas y valores originales de las fuentes permanecen visibles.

Un valor de origen superior solo significa un mejor rendimiento en este benchmark y esta configuración. No es una puntuación comparable entre benchmarks ni de preparación para producción.

Comparar elementos equivalentes

Resumen de la decisión

Solo pueden incluirse en una misma comparación configuraciones de la misma versión de la prueba de referencia y con el mismo alcance de tareas.

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.
AnthropicOSWorld Agent · Claude Opus 4.7 · Max · Standard
Finalización binaria13.9%Coste por tarea completada con éxitoNo publicadoIntervalo de resultados publicadosNo publicado
Detalles del Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Finalización binaria20.6%Coste por tarea completada con éxitoNo publicadoIntervalo de resultados publicadosNo publicado
Detalles del Agent
15 campos idénticos o sin datos se ocultan
Sistema AgentOSWorld Agent · Claude Opus 4.7 · Max · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuración
Modelo baseClaude Opus 4.7Claude Opus 4.8
ID o etiqueta del modelo en la fuenteClaude Opus 4.7Claude Opus 4.8
HerramientasHerramienta estándar de uso de computadorasHerramienta por lotes de uso de ordenadores
Resultado
Finalización binaria13.9%20.6%
Puntuación parcial49.1%54.8%
Coste comunicado de la prueba de referencia3870 US$No publicado
Fuente
Abrir fuenteAbrir fuenteAbrir fuente

Configuración

OSWorld Agent · Claude Opus 4.7 · Max · Standard

Modelo base
Claude Opus 4.7
ID o etiqueta del modelo en la fuente
Claude Opus 4.7
Herramientas
Herramienta estándar de uso de computadoras

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modelo base
Claude Opus 4.8
ID o etiqueta del modelo en la fuente
Claude Opus 4.8
Herramientas
Herramienta por lotes de uso de ordenadores

Resultado

OSWorld Agent · Claude Opus 4.7 · Max · Standard

Finalización binaria
13.9%
Puntuación parcial
49.1%
Coste comunicado de la prueba de referencia
3870 US$

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Finalización binaria
20.6%
Puntuación parcial
54.8%
Coste comunicado de la prueba de referencia
No publicado

Fuente

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.

Validar antes de adoptar

Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.

  1. 1

    Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.

  2. 2

    Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.

  3. 3

    Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.

  4. 4

    Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.

Directorio y evaluaciones de Agents