Agenten-Benchmarks
WebArena Agenten-Benchmark
OpenGPT hält 0 veröffentlichte Zeilen mit der unten gezeigten exakten Benchmark-Version WebArena und Umgebung verknüpft.
- Aufgaben
- 812
- Veröffentlichte Zeilen
- 0
- Datum der Quelldaten
- Identität geprüft
- Prüfung erforderlich
Nachweisumfang
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
How OpenGPT handles this evidence
OpenGPT bewahrt Kennzahl, Aufgabenumfang, Umgebung, Version, Konfigurationsfelder und Quelldatum des Herausgebers. Es erstellt keine Benchmark-übergreifende Agent-Gesamtpunktzahl.
Vergleichsgrenzen
- Ein höheres Ergebnis gilt nur für die angezeigte Benchmark-Version und die entsprechenden Bedingungen.
- Die Ergebnisse der Agenten spiegeln das Gesamtsystem wider, nicht nur das Basismodell.
- Fehlende Daten zu Kosten, Zuverlässigkeit, Sicherheit oder Latenz werden weiterhin als nicht gemeldet ausgewiesen und nicht abgeleitet.
- OpenGPT hat den offiziellen Benchmark-Umfang verifiziert, aber noch keinen direkt vergleichbaren Ergebnis-Snapshot mit vollständigen Konfigurationen festgeschrieben.
v0.2.0 · canonical self-hosted environment
0 von 0 veröffentlichten Zeilen werden angezeigt. Jedes Ergebnis bleibt mit dem Quellbenchmark und der Konfiguration verknüpft.