Benchmarks de Agents

Benchmark de agentes de WebArena

OpenGPT mantiene 0 filas publicadas asociadas a la versión WebArena exacta de la prueba de referencia y al entorno que se muestran a continuación.

Tareas
812
Filas publicadas
0
Fecha de los datos de la fuente
Identidad revisada
Se requiere revisión

Alcance de la evidencia

v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.

How OpenGPT handles this evidence

OpenGPT conserva la métrica, el alcance de tareas, el entorno, la versión, los campos de configuración y la fecha de la fuente del editor. No crea una puntuación general de agentes entre pruebas de referencia distintas.

Límites de la comparación

  • Un resultado superior solo se aplica a la versión y las condiciones del benchmark mostradas.
  • Los resultados de Agents reflejan el sistema completo, no solo el modelo base.
  • Los datos ausentes sobre coste, fiabilidad, seguridad o latencia se mantienen sin informar, en lugar de inferirse.
  • OpenGPT ha verificado el alcance oficial de la prueba de referencia, pero aún no ha fijado una instantánea de resultados completa por configuración y directamente comparable.

v0.2.0 · canonical self-hosted environment

Mostrando 0 de 0 filas publicadas. Cada resultado permanece vinculado al benchmark y a la configuración de origen.