Escopo compartilhado do benchmark · OSWorld 2.0

Comparação de agentes no mesmo benchmark

As entradas abaixo compartilham o mesmo escopo de benchmark. As estruturas, versões de modelos, datas e valores originais exatos das fontes permanecem visíveis.

Um valor de origem mais alto significa apenas um desempenho melhor neste benchmark e nesta configuração. Não é uma pontuação comparável entre benchmarks nem de prontidão para produção.

Compare opções equivalentes

Visão geral da decisão

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
Alibaba QwenOSWorld Agent · Qwen 3.7-Plus · Thinking · Standard
Conclusão binária2.8%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Conclusão binária20.6%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
15 campos idênticos ou totalmente sem dados ocultos
Sistema AgentOSWorld Agent · Qwen 3.7-Plus · Thinking · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuração
Modelo baseQwen 3.7-PlusClaude Opus 4.8
ID ou rótulo do modelo na fonteQwen 3.7-PlusClaude Opus 4.8
FerramentasFerramenta padrão de uso do computadorFerramenta de uso do computador com processamento em lotes
Resultado
Conclusão binária2.8%20.6%
Pontuação parcial21.5%54.8%
Custo informado do benchmarkUS$ 411,56Não publicado
Fonte
Abrir fonteAbrir fonteAbrir fonte

Configuração

OSWorld Agent · Qwen 3.7-Plus · Thinking · Standard

Modelo base
Qwen 3.7-Plus
ID ou rótulo do modelo na fonte
Qwen 3.7-Plus
Ferramentas
Ferramenta padrão de uso do computador

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modelo base
Claude Opus 4.8
ID ou rótulo do modelo na fonte
Claude Opus 4.8
Ferramentas
Ferramenta de uso do computador com processamento em lotes

Resultado

OSWorld Agent · Qwen 3.7-Plus · Thinking · Standard

Conclusão binária
2.8%
Pontuação parcial
21.5%
Custo informado do benchmark
US$ 411,56

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Conclusão binária
20.6%
Pontuação parcial
54.8%
Custo informado do benchmark
Não publicado

Fonte

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents