Escopo compartilhado do benchmark · OSWorld 2.0

Comparação de agentes no mesmo benchmark

As entradas abaixo compartilham o mesmo escopo de benchmark. As estruturas, versões de modelos, datas e valores originais exatos das fontes permanecem visíveis.

Um valor de origem mais alto significa apenas um desempenho melhor neste benchmark e nesta configuração. Não é uma pontuação comparável entre benchmarks nem de prontidão para produção.

Compare opções equivalentes

Visão geral da decisão

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Standard
Conclusão binária18.52%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Conclusão binária20.6%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
18 campos idênticos ou totalmente sem dados ocultos
Sistema AgentOSWorld Agent · Claude Opus 4.8 · Max · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuração
FerramentasFerramenta padrão de uso do computadorFerramenta de uso do computador com processamento em lotes
Resultado
Conclusão binária18.52%20.6%
Pontuação parcial49.33%54.8%
Fonte
Abrir fonteAbrir fonteAbrir fonte

Configuração

OSWorld Agent · Claude Opus 4.8 · Max · Standard

Ferramentas
Ferramenta padrão de uso do computador

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Ferramentas
Ferramenta de uso do computador com processamento em lotes

Resultado

OSWorld Agent · Claude Opus 4.8 · Max · Standard

Conclusão binária
18.52%
Pontuação parcial
49.33%

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Conclusão binária
20.6%
Pontuação parcial
54.8%

Fonte

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents