Benchmarks de Agents

Benchmark de agentes de OSWorld 2.0

OpenGPT mantiene 10 filas publicadas asociadas a la versión OSWorld 2.0 exacta de la prueba de referencia y al entorno que se muestran a continuación.

Tareas
108
Filas publicadas
10
Fecha de los datos de la fuente
Identidad revisada
Histórico

Alcance de la evidencia

task version v2026.06.24 · 500-step budget. long-horizon computer workflows. Desktop applications and operating-system workflows en reproducible VMs. 500 steps.

How OpenGPT handles this evidence

OpenGPT conserva la métrica, el alcance de tareas, el entorno, la versión, los campos de configuración y la fecha de la fuente del editor. No crea una puntuación general de agentes entre pruebas de referencia distintas.

Límites de la comparación

  • Un resultado superior solo se aplica a la versión y las condiciones del benchmark mostradas.
  • Los resultados de Agents reflejan el sistema completo, no solo el modelo base.
  • Los datos ausentes sobre coste, fiabilidad, seguridad o latencia se mantienen sin informar, en lugar de inferirse.
  • Las filas conservan como evidencia histórica el resultado anclado a la versión v2026.06.24. No se vuelve a etiquetar como actual porque la versión activa v2026.08.08 del benchmark cambia la semántica de las tareas y no se dispone de una instantánea equivalente de resultados actuales.

task version v2026.06.24 · 500-step budget

Mostrando 10 de 10 filas publicadas. Cada resultado permanece vinculado al benchmark y a la configuración de origen.

  1. OSWorld Agent · Claude Opus 4.8 · Max · Batched toolAnthropic · Claude Opus 4.8#1Binary completion: 20.6%Agente de uso de ordenadores OSWorld 2.0
  2. OSWorld Agent · Claude Opus 4.8 · Max · StandardAnthropic · Claude Opus 4.8#2Binary completion: 18.52%Agente de uso de ordenadores OSWorld 2.0
  3. OSWorld Agent · Claude Opus 4.7 · Max · Batched toolAnthropic · Claude Opus 4.7#3Binary completion: 18.2%Agente de uso de ordenadores OSWorld 2.0
  4. OSWorld Agent · Claude Opus 4.7 · Max · StandardAnthropic · Claude Opus 4.7#4Binary completion: 13.9%Agente de uso de ordenadores OSWorld 2.0
  5. OSWorld Agent · GPT-5.5 · Xhigh · Batch toolOpenAI · GPT-5.5#5Binary completion: 13.0%Agente de uso de ordenadores OSWorld 2.0
  6. OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardAnthropic · Claude Sonnet 4.6#6Binary completion: 9.3%Agente de uso de ordenadores OSWorld 2.0
  7. OSWorld Agent · Claude Sonnet 4.6 · Max · StandardAnthropic · Claude Sonnet 4.6#7Binary completion: 8.3%Agente de uso de ordenadores OSWorld 2.0
  8. OSWorld Agent · MiniMax M3 · Enabled · StandardMiniMax · MiniMax M3#8Binary completion: 4.6%Agente de uso de ordenadores OSWorld 2.0
  9. OSWorld Agent · Kimi 2.6 · Enabled · StandardMoonshot AI · Kimi 2.6#8Binary completion: 4.6%Agente de uso de ordenadores OSWorld 2.0
  10. OSWorld Agent · Qwen 3.7-Plus · Thinking · StandardAlibaba Qwen · Qwen 3.7-Plus#10Binary completion: 2.8%Agente de uso de ordenadores OSWorld 2.0