Agent 評測
WebArena Agent 評測
OpenGPT 將0筆公開記錄保留在下方所示的 WebArena 評測版本與環境內。
- 工作
- 812
- 公開記錄
- 0
- 來源資料日期
- 身分核驗日期
- 需要複核
資料範圍
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
OpenGPT 如何處理這些資料
OpenGPT 保留發布方的指標、工作範圍、環境、版本、設定欄位與資料日期,不產生跨評測 Agent 總分。
可比範圍
- 更高結果只適用於所展示的評測版本與條件。
- Agent 結果反映完整系統,而不是基礎模型單獨能力。
- 成本、穩定性、安全性或速度沒有公開時保持未報告,不進行推測。
- OpenGPT has verified the official benchmark scope, but has not yet frozen a configuration-complete, directly comparable result snapshot.
v0.2.0 · canonical self-hosted environment
展示0筆公開記錄中的0筆;每項結果都保留來源評測與設定。