エージェント評価
WebArenaエージェント評価
WebArenaの表示版と環境に結び付いた公開行0件を保持します。
- 課題
- 812
- 公開行
- 0
- 情報源データ日
- ID確認日
- 要確認
根拠の範囲
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
OpenGPTでの根拠の扱い
公開元の指標、課題範囲、環境、版、構成、日付を保持し、評価を横断した総合点は作りません。
比較できる範囲
- 高い値は表示された評価版と条件にだけ適用されます。
- 結果は基盤モデル単体ではなくエージェント全体を反映します。
- 費用、信頼性、安全性、速度の欠損値は推測しません。
- OpenGPT has verified the official benchmark scope, but has not yet frozen a configuration-complete, directly comparable result snapshot.
v0.2.0 · canonical self-hosted environment
公開0件のうち0件を表示します。結果は元の評価と構成に結び付いています。