Agenten-Benchmarks

WebArena Agenten-Benchmark

OpenGPT hält 0 veröffentlichte Zeilen mit der unten gezeigten exakten Benchmark-Version WebArena und Umgebung verknüpft.

Aufgaben
812
Veröffentlichte Zeilen
0
Datum der Quelldaten
Identität geprüft
Prüfung erforderlich

Nachweisumfang

v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.

How OpenGPT handles this evidence

OpenGPT bewahrt Kennzahl, Aufgabenumfang, Umgebung, Version, Konfigurationsfelder und Quelldatum des Herausgebers. Es erstellt keine Benchmark-übergreifende Agent-Gesamtpunktzahl.

Vergleichsgrenzen

  • Ein höheres Ergebnis gilt nur für die angezeigte Benchmark-Version und die entsprechenden Bedingungen.
  • Die Ergebnisse der Agenten spiegeln das Gesamtsystem wider, nicht nur das Basismodell.
  • Fehlende Daten zu Kosten, Zuverlässigkeit, Sicherheit oder Latenz werden weiterhin als nicht gemeldet ausgewiesen und nicht abgeleitet.
  • OpenGPT hat den offiziellen Benchmark-Umfang verifiziert, aber noch keinen direkt vergleichbaren Ergebnis-Snapshot mit vollständigen Konfigurationen festgeschrieben.

v0.2.0 · canonical self-hosted environment

0 von 0 veröffentlichten Zeilen werden angezeigt. Jedes Ergebnis bleibt mit dem Quellbenchmark und der Konfiguration verknüpft.