Benchmarks de Agents
Benchmark de agentes de WebArena
OpenGPT mantiene 0 filas publicadas asociadas a la versión WebArena exacta de la prueba de referencia y al entorno que se muestran a continuación.
- Tareas
- 812
- Filas publicadas
- 0
- Fecha de los datos de la fuente
- Identidad revisada
- Se requiere revisión
Alcance de la evidencia
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
How OpenGPT handles this evidence
OpenGPT conserva la métrica, el alcance de tareas, el entorno, la versión, los campos de configuración y la fecha de la fuente del editor. No crea una puntuación general de agentes entre pruebas de referencia distintas.
Límites de la comparación
- Un resultado superior solo se aplica a la versión y las condiciones del benchmark mostradas.
- Los resultados de Agents reflejan el sistema completo, no solo el modelo base.
- Los datos ausentes sobre coste, fiabilidad, seguridad o latencia se mantienen sin informar, en lugar de inferirse.
- OpenGPT ha verificado el alcance oficial de la prueba de referencia, pero aún no ha fijado una instantánea de resultados completa por configuración y directamente comparable.
v0.2.0 · canonical self-hosted environment
Mostrando 0 de 0 filas publicadas. Cada resultado permanece vinculado al benchmark y a la configuración de origen.