Benchmarks de Agents

Benchmark de agentes de OSWorld 2.0

O OpenGPT mantém 10 linhas publicadas vinculadas à versão exata OSWorld 2.0 do benchmark e ao ambiente exibido abaixo.

Tarefas
108
Linhas publicadas
10
Data dos dados da fonte
Identidade revisada
Histórico

Escopo das evidências

task version v2026.06.24 · 500-step budget. long-horizon computer workflows. Desktop applications and operating-system workflows em reproducible VMs. 500 steps.

How OpenGPT handles this evidence

O OpenGPT preserva a métrica, o escopo de tarefas, o ambiente, a versão, os campos de configuração e a data da fonte fornecidos pelo publicador. Ele não cria uma pontuação geral de Agentes que combine benchmarks.

Limites da comparação

  • Um resultado mais alto se aplica apenas à versão e às condições do benchmark exibidas.
  • Os resultados de Agents refletem o sistema completo, não apenas o modelo base.
  • Dados ausentes de custo, confiabilidade, segurança ou latência continuam sem ser informados, em vez de serem inferidos.
  • As linhas preservam como evidência histórica o resultado fixado na versão v2026.06.24. Elas não são reclassificadas como atuais porque a versão ativa v2026.08.08 do benchmark muda a semântica das tarefas e não há um instantâneo atual correspondente dos resultados.

task version v2026.06.24 · 500-step budget

Mostrando 10 de 10 linhas publicadas. Cada resultado permanece vinculado ao benchmark e à configuração da fonte.

  1. OSWorld Agent · Claude Opus 4.8 · Max · Batched toolAnthropic · Claude Opus 4.8#1Binary completion: 20.6%Agente de uso do computador OSWorld 2.0
  2. OSWorld Agent · Claude Opus 4.8 · Max · StandardAnthropic · Claude Opus 4.8#2Binary completion: 18.52%Agente de uso do computador OSWorld 2.0
  3. OSWorld Agent · Claude Opus 4.7 · Max · Batched toolAnthropic · Claude Opus 4.7#3Binary completion: 18.2%Agente de uso do computador OSWorld 2.0
  4. OSWorld Agent · Claude Opus 4.7 · Max · StandardAnthropic · Claude Opus 4.7#4Binary completion: 13.9%Agente de uso do computador OSWorld 2.0
  5. OSWorld Agent · GPT-5.5 · Xhigh · Batch toolOpenAI · GPT-5.5#5Binary completion: 13.0%Agente de uso do computador OSWorld 2.0
  6. OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardAnthropic · Claude Sonnet 4.6#6Binary completion: 9.3%Agente de uso do computador OSWorld 2.0
  7. OSWorld Agent · Claude Sonnet 4.6 · Max · StandardAnthropic · Claude Sonnet 4.6#7Binary completion: 8.3%Agente de uso do computador OSWorld 2.0
  8. OSWorld Agent · MiniMax M3 · Enabled · StandardMiniMax · MiniMax M3#8Binary completion: 4.6%Agente de uso do computador OSWorld 2.0
  9. OSWorld Agent · Kimi 2.6 · Enabled · StandardMoonshot AI · Kimi 2.6#8Binary completion: 4.6%Agente de uso do computador OSWorld 2.0
  10. OSWorld Agent · Qwen 3.7-Plus · Thinking · StandardAlibaba Qwen · Qwen 3.7-Plus#10Binary completion: 2.8%Agente de uso do computador OSWorld 2.0