Configuração de Agent · AssistantBench

Browser-Use · DeepSeek R1 (May 2025)

O objeto classificado: modelo, estrutura, ferramentas, permissões, orçamento e ambiente em conjunto.

Precisão8.75%
Custo por tarefa concluída com sucessoUS$ 6,3
Faixa de resultados publicadaNão publicado

01

Configuração

Sistema AgentBrowser-Use · DeepSeek R1 (May 2025)
Modelo baseDeepSeek R1 (May 2025)
ID ou rótulo do modelo na fonteDeepSeek R1 (May 2025)
EstruturaBrowser-Use
Versão da estruturaNão informado
FerramentasBrowser-Use live-web browser automation
AmbienteTarefas de pesquisa e navegação na web em tempo real reproduzidas pelo Holistic Agent Leaderboard
OrçamentoEspecífico da fonte · nenhum limite normalizado de etapas ou tokens publicado

02

Resultado

Precisão8.75%
Pontuação parcialNão publicado
Custo por tarefa concluída com sucessoUS$ 6,3
Custo informado do benchmarkUS$ 18,18
Tempo mediano de conclusãoNão publicado
Intervenção humanaNão publicado

03

Operação

Evidências de execuções repetidas1 execuções
Faixa de resultados publicadaNão publicado
Observação de segurançaNão publicado
Grupo de comparabilidadehal-assistantbench-public-33-browser-use
Data da avaliaçãoNão publicado
Dados registrados

04

Confiança

EvidênciaRegistro público completo da execução
FonteHolistic Agent Leaderboard · AssistantBench
Instantâneo da fonteInstantâneo verificado do HAL · 33 tarefas públicas · 1 estrutura
Data dos dados da fonteNão publicado pela fonte
Recuperado pelo OpenGPT
Última mudança na classificaçãoAinda não há histórico comparável
Última verificação
Tarefas33 tarefas públicas de navegação verificáveis automaticamente
Nível de evidênciaAlerta externo
Observação sobre as evidências

O HAL reproduziu essas linhas públicas e publica rastros, custos e contagens de execuções. Trate o instantâneo como histórico: o HAL suspendeu a inclusão de novos modelos, e os custos informados não incluem os benefícios do cache.

Abrir auditoria

O que este resultado não comprova

Este resultado se aplica às condições exatas do sistema e da fonte exibidas aqui. Ele não estabelece qual é o melhor agente universal, nem comprova confiabilidade em produção, governança de dados ou desempenho em outra versão do benchmark.

Compare opções equivalentes

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents