Benchmarks de Agents
Benchmark de agentes de OSWorld 2.0
O OpenGPT mantém 10 linhas publicadas vinculadas à versão exata OSWorld 2.0 do benchmark e ao ambiente exibido abaixo.
- Tarefas
- 108
- Linhas publicadas
- 10
- Data dos dados da fonte
- Identidade revisada
- Histórico
Escopo das evidências
task version v2026.06.24 · 500-step budget. long-horizon computer workflows. Desktop applications and operating-system workflows em reproducible VMs. 500 steps.
How OpenGPT handles this evidence
O OpenGPT preserva a métrica, o escopo de tarefas, o ambiente, a versão, os campos de configuração e a data da fonte fornecidos pelo publicador. Ele não cria uma pontuação geral de Agentes que combine benchmarks.
Limites da comparação
- Um resultado mais alto se aplica apenas à versão e às condições do benchmark exibidas.
- Os resultados de Agents refletem o sistema completo, não apenas o modelo base.
- Dados ausentes de custo, confiabilidade, segurança ou latência continuam sem ser informados, em vez de serem inferidos.
- As linhas preservam como evidência histórica o resultado fixado na versão v2026.06.24. Elas não são reclassificadas como atuais porque a versão ativa v2026.08.08 do benchmark muda a semântica das tarefas e não há um instantâneo atual correspondente dos resultados.
task version v2026.06.24 · 500-step budget
Mostrando 10 de 10 linhas publicadas. Cada resultado permanece vinculado ao benchmark e à configuração da fonte.
- OSWorld Agent · Claude Opus 4.8 · Max · Batched toolAnthropic · Claude Opus 4.8#1Binary completion: 20.6%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · Claude Opus 4.8 · Max · StandardAnthropic · Claude Opus 4.8#2Binary completion: 18.52%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · Claude Opus 4.7 · Max · Batched toolAnthropic · Claude Opus 4.7#3Binary completion: 18.2%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · Claude Opus 4.7 · Max · StandardAnthropic · Claude Opus 4.7#4Binary completion: 13.9%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · GPT-5.5 · Xhigh · Batch toolOpenAI · GPT-5.5#5Binary completion: 13.0%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardAnthropic · Claude Sonnet 4.6#6Binary completion: 9.3%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · Claude Sonnet 4.6 · Max · StandardAnthropic · Claude Sonnet 4.6#7Binary completion: 8.3%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · MiniMax M3 · Enabled · StandardMiniMax · MiniMax M3#8Binary completion: 4.6%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · Kimi 2.6 · Enabled · StandardMoonshot AI · Kimi 2.6#8Binary completion: 4.6%Agente de uso do computador OSWorld 2.0
- OSWorld Agent · Qwen 3.7-Plus · Thinking · StandardAlibaba Qwen · Qwen 3.7-Plus#10Binary completion: 2.8%Agente de uso do computador OSWorld 2.0