Escopo compartilhado do benchmark · OSWorld 2.0

Comparação de agentes no mesmo benchmark

As entradas abaixo compartilham o mesmo escopo de benchmark. As estruturas, versões de modelos, datas e valores originais exatos das fontes permanecem visíveis.

Um valor de origem mais alto significa apenas um desempenho melhor neste benchmark e nesta configuração. Não é uma pontuação comparável entre benchmarks nem de prontidão para produção.

Compare opções equivalentes

Visão geral da decisão

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
OpenAIOSWorld Agent · GPT-5.5 · Xhigh · Batch tool
Conclusão binária13.0%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Conclusão binária20.6%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
15 campos idênticos ou totalmente sem dados ocultos
Sistema AgentOSWorld Agent · GPT-5.5 · Xhigh · Batch toolOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuração
Modelo baseGPT-5.5Claude Opus 4.8
ID ou rótulo do modelo na fonteGPT-5.5Claude Opus 4.8
FerramentasFerramenta de uso do computador em loteFerramenta de uso do computador com processamento em lotes
Resultado
Conclusão binária13.0%20.6%
Pontuação parcial49.5%54.8%
Custo informado do benchmarkUS$ 2.750Não publicado
Fonte
Abrir fonteAbrir fonteAbrir fonte

Configuração

OSWorld Agent · GPT-5.5 · Xhigh · Batch tool

Modelo base
GPT-5.5
ID ou rótulo do modelo na fonte
GPT-5.5
Ferramentas
Ferramenta de uso do computador em lote

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modelo base
Claude Opus 4.8
ID ou rótulo do modelo na fonte
Claude Opus 4.8
Ferramentas
Ferramenta de uso do computador com processamento em lotes

Resultado

OSWorld Agent · GPT-5.5 · Xhigh · Batch tool

Conclusão binária
13.0%
Pontuação parcial
49.5%
Custo informado do benchmark
US$ 2.750

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Conclusão binária
20.6%
Pontuação parcial
54.8%
Custo informado do benchmark
Não publicado

Fonte

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents