Escopo compartilhado do benchmark · OSWorld 2.0
Comparação de agentes no mesmo benchmark
As entradas abaixo compartilham o mesmo escopo de benchmark. As estruturas, versões de modelos, datas e valores originais exatos das fontes permanecem visíveis.
Um valor de origem mais alto significa apenas um desempenho melhor neste benchmark e nesta configuração. Não é uma pontuação comparável entre benchmarks nem de prontidão para produção.
Compare opções equivalentes
Visão geral da decisão
Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.
| Sistema Agent | OSWorld Agent · GPT-5.5 · Xhigh · Batch tool | OSWorld Agent · Claude Opus 4.8 · Max · Batched tool |
|---|---|---|
| Configuração | ||
| Modelo base | GPT-5.5 | Claude Opus 4.8 |
| ID ou rótulo do modelo na fonte | GPT-5.5 | Claude Opus 4.8 |
| Ferramentas | Ferramenta de uso do computador em lote | Ferramenta de uso do computador com processamento em lotes |
| Resultado | ||
| Conclusão binária | 13.0% | 20.6% |
| Pontuação parcial | 49.5% | 54.8% |
| Custo informado do benchmark | US$ 2.750 | Não publicado |
| Fonte | ||
| Abrir fonte | Abrir fonte ↗ | Abrir fonte ↗ |
Configuração
OSWorld Agent · GPT-5.5 · Xhigh · Batch tool
- Modelo base
- GPT-5.5
- ID ou rótulo do modelo na fonte
- GPT-5.5
- Ferramentas
- Ferramenta de uso do computador em lote
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Modelo base
- Claude Opus 4.8
- ID ou rótulo do modelo na fonte
- Claude Opus 4.8
- Ferramentas
- Ferramenta de uso do computador com processamento em lotes
Resultado
OSWorld Agent · GPT-5.5 · Xhigh · Batch tool
- Conclusão binária
- 13.0%
- Pontuação parcial
- 49.5%
- Custo informado do benchmark
- US$ 2.750
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
- Conclusão binária
- 20.6%
- Pontuação parcial
- 54.8%
- Custo informado do benchmark
- Não publicado
Fonte
OSWorld Agent · GPT-5.5 · Xhigh · Batch tool
OSWorld Agent · Claude Opus 4.8 · Max · Batched tool
Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
Validar antes da adoção
As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.
- 1
Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.
- 2
Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.
- 3
Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.
- 4
Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.