Benchmarks de Agents

Benchmark de agentes de WebArena

O OpenGPT mantém 0 linhas publicadas vinculadas à versão exata WebArena do benchmark e ao ambiente exibido abaixo.

Tarefas
812
Linhas publicadas
0
Data dos dados da fonte
Identidade revisada
Revisão necessária

Escopo das evidências

v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.

How OpenGPT handles this evidence

O OpenGPT preserva a métrica, o escopo de tarefas, o ambiente, a versão, os campos de configuração e a data da fonte fornecidos pelo publicador. Ele não cria uma pontuação geral de Agentes que combine benchmarks.

Limites da comparação

  • Um resultado mais alto se aplica apenas à versão e às condições do benchmark exibidas.
  • Os resultados de Agents refletem o sistema completo, não apenas o modelo base.
  • Dados ausentes de custo, confiabilidade, segurança ou latência continuam sem ser informados, em vez de serem inferidos.
  • O OpenGPT verificou o escopo oficial do benchmark, mas ainda não congelou um instantâneo de resultados diretamente comparáveis com configurações completas.

v0.2.0 · canonical self-hosted environment

Mostrando 0 de 0 linhas publicadas. Cada resultado permanece vinculado ao benchmark e à configuração da fonte.