Configuração de Agent · OSWorld 2.0

OSWorld Agent · Kimi 2.6 · Enabled · Standard

O objeto classificado: modelo, estrutura, ferramentas, permissões, orçamento e ambiente em conjunto.

Conclusão binária4.6%
Custo por tarefa concluída com sucessoNão publicado
Faixa de resultados publicadaNão publicado

01

Configuração

Sistema AgentOSWorld Agent · Kimi 2.6 · Enabled · Standard
Modelo baseKimi 2.6
ID ou rótulo do modelo na fonteKimi 2.6
EstruturaOSWorld 2.0 computer-use agent
Versão da estruturaOSWorld 2.0
FerramentasStandard computer-use tool
AmbienteAplicativos para desktop e fluxos do sistema operacional em máquinas virtuais reproduzíveis
Orçamento500 etapas

02

Resultado

Conclusão binária4.6%
Pontuação parcial22.1%
Custo por tarefa concluída com sucessoNão publicado
Custo informado do benchmarkUS$ 708
Tempo mediano de conclusãoNão publicado
Intervenção humanaNão publicado

03

Operação

Evidências de execuções repetidasNão publicado
Faixa de resultados publicadaNão publicado
Observação de segurançaNão publicado
Grupo de comparabilidadeosworld-2-v2026-06-24-500
Data da avaliação
Dados registrados

04

Confiança

EvidênciaListado pelo publicador do benchmark
FonteOSWorld 2.0
Instantâneo da fonteVersão da tarefa v2026.06.24 · orçamento de 500 etapas
Data dos dados da fonte
Recuperado pelo OpenGPT
Última mudança na classificaçãoAinda não há histórico comparável
Última verificação
Tarefas108 fluxos de computador de longa duração
Nível de evidênciaAlerta externo
Observação sobre as evidências

As linhas preservam o agente, o modelo, o modo da ferramenta, a versão da tarefa, o limite de etapas e as métricas da fonte informados.

Abrir auditoria

O que este resultado não comprova

Este resultado se aplica às condições exatas do sistema e da fonte exibidas aqui. Ele não estabelece qual é o melhor agente universal, nem comprova confiabilidade em produção, governança de dados ou desempenho em outra versão do benchmark.

Compare opções equivalentes

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents