Escopo compartilhado do benchmark · OSWorld 2.0

Comparação de agentes no mesmo benchmark

As entradas abaixo compartilham o mesmo escopo de benchmark. As estruturas, versões de modelos, datas e valores originais exatos das fontes permanecem visíveis.

Um valor de origem mais alto significa apenas um desempenho melhor neste benchmark e nesta configuração. Não é uma pontuação comparável entre benchmarks nem de prontidão para produção.

Compare opções equivalentes

Visão geral da decisão

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
MiniMaxOSWorld Agent · MiniMax M3 · Enabled · Standard
Conclusão binária4.6%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Conclusão binária20.6%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
15 campos idênticos ou totalmente sem dados ocultos
Sistema AgentOSWorld Agent · MiniMax M3 · Enabled · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Configuração
Modelo baseMiniMax M3Claude Opus 4.8
ID ou rótulo do modelo na fonteMiniMax M3Claude Opus 4.8
FerramentasFerramenta padrão de uso do computadorFerramenta de uso do computador com processamento em lotes
Resultado
Conclusão binária4.6%20.6%
Pontuação parcial22.3%54.8%
Custo informado do benchmarkUS$ 258,78Não publicado
Fonte
Abrir fonteAbrir fonteAbrir fonte

Configuração

OSWorld Agent · MiniMax M3 · Enabled · Standard

Modelo base
MiniMax M3
ID ou rótulo do modelo na fonte
MiniMax M3
Ferramentas
Ferramenta padrão de uso do computador

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Modelo base
Claude Opus 4.8
ID ou rótulo do modelo na fonte
Claude Opus 4.8
Ferramentas
Ferramenta de uso do computador com processamento em lotes

Resultado

OSWorld Agent · MiniMax M3 · Enabled · Standard

Conclusão binária
4.6%
Pontuação parcial
22.3%
Custo informado do benchmark
US$ 258,78

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

Conclusão binária
20.6%
Pontuação parcial
54.8%
Custo informado do benchmark
Não publicado

Fonte

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents