Escopo compartilhado do benchmark · OSWorld 2.0

Comparação de agentes no mesmo benchmark

As entradas abaixo compartilham o mesmo escopo de benchmark. As estruturas, versões de modelos, datas e valores originais exatos das fontes permanecem visíveis.

Um valor de origem mais alto significa apenas um desempenho melhor neste benchmark e nesta configuração. Não é uma pontuação comparável entre benchmarks nem de prontidão para produção.

Compare opções equivalentes

Visão geral da decisão

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
AnthropicOSWorld Agent · Claude Sonnet 4.6 · Max · Standard
Conclusão binária8.3%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Conclusão binária20.6%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
15 campos idênticos ou totalmente sem dados ocultos
Sistema AgentOSWorld Agent · Claude Sonnet 4.6 · Max · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuração
Modelo baseClaude Sonnet 4.6Claude Opus 4.8
ID ou rótulo do modelo na fonteClaude Sonnet 4.6Claude Opus 4.8
FerramentasFerramenta padrão de uso do computadorFerramenta de uso do computador com processamento em lotes
Resultado
Conclusão binária8.3%20.6%
Pontuação parcial41.5%54.8%
Custo informado do benchmarkUS$ 2.410Não publicado
Fonte
Abrir fonteAbrir fonteAbrir fonte

Configuração

OSWorld Agent · Claude Sonnet 4.6 · Max · Standard

Modelo base
Claude Sonnet 4.6
ID ou rótulo do modelo na fonte
Claude Sonnet 4.6
Ferramentas
Ferramenta padrão de uso do computador

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modelo base
Claude Opus 4.8
ID ou rótulo do modelo na fonte
Claude Opus 4.8
Ferramentas
Ferramenta de uso do computador com processamento em lotes

Resultado

OSWorld Agent · Claude Sonnet 4.6 · Max · Standard

Conclusão binária
8.3%
Pontuação parcial
41.5%
Custo informado do benchmark
US$ 2.410

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Conclusão binária
20.6%
Pontuação parcial
54.8%
Custo informado do benchmark
Não publicado

Fonte

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents