Benchmarks d’Agents

Benchmark d’agents de WebArena

OpenGPT conserve 0 lignes publiées, associées à la version WebArena exacte du benchmark et à l’environnement indiqués ci-dessous.

Tâches
812
Lignes publiées
0
Date des données sources
Identité examinée
Examen nécessaire

Périmètre des preuves

v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.

How OpenGPT handles this evidence

OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.

Limites de la comparaison

  • Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
  • Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
  • Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
  • OpenGPT a vérifié le périmètre officiel du benchmark, mais n’a pas encore figé d’instantané de résultats directement comparables comprenant l’intégralité des configurations.

v0.2.0 · canonical self-hosted environment

Affichage de 0 lignes publiées sur 0. Chaque résultat reste associé au benchmark et à la configuration de sa source.