Agent-benchmarks
WebArena agent-benchmark
OpenGPT houdt 0 gepubliceerde rijen gekoppeld aan de exacte WebArena-benchmarkversie en hieronder weergegeven omgeving.
- Taken
- 812
- Gepubliceerde rijen
- 0
- Datum van brongegevens
- Identiteit beoordeeld
- Beoordeling nodig
Bewijsbereik
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
How OpenGPT handles this evidence
OpenGPT behoudt de meetwaarde, het taakbereik, de omgeving, versie, configuratievelden en brondatum van de uitgever. Het maakt geen algehele Agent-score over benchmarks heen.
Vergelijkingsgrenzen
- Een hoger resultaat geldt alleen voor de weergegeven benchmarkversie en de bijbehorende voorwaarden.
- Agentresultaten weerspiegelen het volledige systeem, niet alleen het basismodel.
- Ontbrekende gegevens over kosten, betrouwbaarheid, veiligheid of latentie worden niet afgeleid maar blijven niet-gerapporteerd.
- OpenGPT heeft het officiële benchmarkbereik geverifieerd, maar nog geen volledig geconfigureerde, rechtstreeks vergelijkbare momentopname van resultaten bevroren.
v0.2.0 · canonical self-hosted environment
0 van 0 gepubliceerde rijen weergegeven. Elk resultaat blijft gekoppeld aan de bronbenchmark en configuratie.