Benchmark degli Agent

Benchmark degli agenti di WebArena

OpenGPT mantiene 0 righe pubblicate associate alla versione esatta del benchmark WebArena e all’ambiente mostrato sotto.

Attività
812
Righe pubblicate
0
Data dei dati della fonte
Identità esaminata
Revisione necessaria

Ambito delle evidenze

v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.

How OpenGPT handles this evidence

OpenGPT conserva la metrica, l’ambito delle attività, l’ambiente, la versione, i campi della configurazione e la data della fonte indicati dal publisher. Non crea un punteggio complessivo degli Agent tra benchmark diversi.

Limiti del confronto

  • Un risultato più elevato si applica solo alla versione del benchmark e alle condizioni visualizzate.
  • I risultati degli Agent riflettono il sistema completo, non soltanto il modello di base.
  • I dati mancanti su costi, affidabilità, sicurezza o latenza restano non indicati anziché essere dedotti.
  • OpenGPT ha verificato l’ambito ufficiale del benchmark, ma non ha ancora fissato un’istantanea dei risultati completa a livello di configurazione e direttamente comparabile.

v0.2.0 · canonical self-hosted environment

Visualizzate 0 di 0 righe pubblicate. Ogni risultato rimane associato al benchmark e alla configurazione della fonte.