エージェント評価

WebArenaエージェント評価

WebArenaの表示版と環境に結び付いた公開行0件を保持します。

課題
812
公開行
0
情報源データ日
ID確認日
要確認

根拠の範囲

v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.

OpenGPTでの根拠の扱い

公開元の指標、課題範囲、環境、版、構成、日付を保持し、評価を横断した総合点は作りません。

比較できる範囲

  • 高い値は表示された評価版と条件にだけ適用されます。
  • 結果は基盤モデル単体ではなくエージェント全体を反映します。
  • 費用、信頼性、安全性、速度の欠損値は推測しません。
  • OpenGPT has verified the official benchmark scope, but has not yet frozen a configuration-complete, directly comparable result snapshot.

v0.2.0 · canonical self-hosted environment

公開0件のうち0件を表示します。結果は元の評価と構成に結び付いています。