Benchmarks de Agents
Benchmark de agentes de WebArena
O OpenGPT mantém 0 linhas publicadas vinculadas à versão exata WebArena do benchmark e ao ambiente exibido abaixo.
- Tarefas
- 812
- Linhas publicadas
- 0
- Data dos dados da fonte
- Identidade revisada
- Revisão necessária
Escopo das evidências
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
How OpenGPT handles this evidence
O OpenGPT preserva a métrica, o escopo de tarefas, o ambiente, a versão, os campos de configuração e a data da fonte fornecidos pelo publicador. Ele não cria uma pontuação geral de Agentes que combine benchmarks.
Limites da comparação
- Um resultado mais alto se aplica apenas à versão e às condições do benchmark exibidas.
- Os resultados de Agents refletem o sistema completo, não apenas o modelo base.
- Dados ausentes de custo, confiabilidade, segurança ou latência continuam sem ser informados, em vez de serem inferidos.
- O OpenGPT verificou o escopo oficial do benchmark, mas ainda não congelou um instantâneo de resultados diretamente comparáveis com configurações completas.
v0.2.0 · canonical self-hosted environment
Mostrando 0 de 0 linhas publicadas. Cada resultado permanece vinculado ao benchmark e à configuração da fonte.