Agent-benchmarks

WebArena agent-benchmark

OpenGPT houdt 0 gepubliceerde rijen gekoppeld aan de exacte WebArena-benchmarkversie en hieronder weergegeven omgeving.

Taken
812
Gepubliceerde rijen
0
Datum van brongegevens
Identiteit beoordeeld
Beoordeling nodig

Bewijsbereik

v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.

How OpenGPT handles this evidence

OpenGPT behoudt de meetwaarde, het taakbereik, de omgeving, versie, configuratievelden en brondatum van de uitgever. Het maakt geen algehele Agent-score over benchmarks heen.

Vergelijkingsgrenzen

  • Een hoger resultaat geldt alleen voor de weergegeven benchmarkversie en de bijbehorende voorwaarden.
  • Agentresultaten weerspiegelen het volledige systeem, niet alleen het basismodel.
  • Ontbrekende gegevens over kosten, betrouwbaarheid, veiligheid of latentie worden niet afgeleid maar blijven niet-gerapporteerd.
  • OpenGPT heeft het officiële benchmarkbereik geverifieerd, maar nog geen volledig geconfigureerde, rechtstreeks vergelijkbare momentopname van resultaten bevroren.

v0.2.0 · canonical self-hosted environment

0 van 0 gepubliceerde rijen weergegeven. Elk resultaat blijft gekoppeld aan de bronbenchmark en configuratie.