Benchmarks d’Agents
Benchmark d’agents de WebArena
OpenGPT conserve 0 lignes publiées, associées à la version WebArena exacte du benchmark et à l’environnement indiqués ci-dessous.
- Tâches
- 812
- Lignes publiées
- 0
- Date des données sources
- Identité examinée
- Examen nécessaire
Périmètre des preuves
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
How OpenGPT handles this evidence
OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.
Limites de la comparaison
- Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
- Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
- Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
- OpenGPT a vérifié le périmètre officiel du benchmark, mais n’a pas encore figé d’instantané de résultats directement comparables comprenant l’intégralité des configurations.
v0.2.0 · canonical self-hosted environment
Affichage de 0 lignes publiées sur 0. Chaque résultat reste associé au benchmark et à la configuration de sa source.