Benchmark degli Agent
Benchmark degli agenti di WebArena
OpenGPT mantiene 0 righe pubblicate associate alla versione esatta del benchmark WebArena e all’ambiente mostrato sotto.
- Attività
- 812
- Righe pubblicate
- 0
- Data dei dati della fonte
- Identità esaminata
- Revisione necessaria
Ambito delle evidenze
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
How OpenGPT handles this evidence
OpenGPT conserva la metrica, l’ambito delle attività, l’ambiente, la versione, i campi della configurazione e la data della fonte indicati dal publisher. Non crea un punteggio complessivo degli Agent tra benchmark diversi.
Limiti del confronto
- Un risultato più elevato si applica solo alla versione del benchmark e alle condizioni visualizzate.
- I risultati degli Agent riflettono il sistema completo, non soltanto il modello di base.
- I dati mancanti su costi, affidabilità, sicurezza o latenza restano non indicati anziché essere dedotti.
- OpenGPT ha verificato l’ambito ufficiale del benchmark, ma non ha ancora fissato un’istantanea dei risultati completa a livello di configurazione e direttamente comparabile.
v0.2.0 · canonical self-hosted environment
Visualizzate 0 di 0 righe pubblicate. Ogni risultato rimane associato al benchmark e alla configurazione della fonte.