Alcance compartido del benchmark · OSWorld 2.0

Comparación de agentes en el mismo benchmark

Las entradas que aparecen a continuación comparten el mismo alcance de benchmark. Sus andamiajes, versiones de modelos, fechas y valores originales de las fuentes permanecen visibles.

Un valor de origen superior solo significa un mejor rendimiento en este benchmark y esta configuración. No es una puntuación comparable entre benchmarks ni de preparación para producción.

Comparar elementos equivalentes

Resumen de la decisión

Solo pueden incluirse en una misma comparación configuraciones de la misma versión de la prueba de referencia y con el mismo alcance de tareas.

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.
AnthropicOSWorld Agent · Claude Sonnet 4.6 · Medium · Standard
Finalización binaria9.3%Coste por tarea completada con éxitoNo publicadoIntervalo de resultados publicadosNo publicado
Detalles del Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Finalización binaria20.6%Coste por tarea completada con éxitoNo publicadoIntervalo de resultados publicadosNo publicado
Detalles del Agent
15 campos idénticos o sin datos se ocultan
Sistema AgentOSWorld Agent · Claude Sonnet 4.6 · Medium · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuración
Modelo baseClaude Sonnet 4.6Claude Opus 4.8
ID o etiqueta del modelo en la fuenteClaude Sonnet 4.6Claude Opus 4.8
HerramientasHerramienta estándar de uso de computadorasHerramienta por lotes de uso de ordenadores
Resultado
Finalización binaria9.3%20.6%
Puntuación parcial33.9%54.8%
Coste comunicado de la prueba de referencia1550 US$No publicado
Fuente
Abrir fuenteAbrir fuenteAbrir fuente

Configuración

OSWorld Agent · Claude Sonnet 4.6 · Medium · Standard

Modelo base
Claude Sonnet 4.6
ID o etiqueta del modelo en la fuente
Claude Sonnet 4.6
Herramientas
Herramienta estándar de uso de computadoras

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modelo base
Claude Opus 4.8
ID o etiqueta del modelo en la fuente
Claude Opus 4.8
Herramientas
Herramienta por lotes de uso de ordenadores

Resultado

OSWorld Agent · Claude Sonnet 4.6 · Medium · Standard

Finalización binaria
9.3%
Puntuación parcial
33.9%
Coste comunicado de la prueba de referencia
1550 US$

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Finalización binaria
20.6%
Puntuación parcial
54.8%
Coste comunicado de la prueba de referencia
No publicado

Fuente

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.

Validar antes de adoptar

Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.

  1. 1

    Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.

  2. 2

    Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.

  3. 3

    Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.

  4. 4

    Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.

Directorio y evaluaciones de Agents