可信度與資料狀態

哪些內容已檢查、審核與發布

查看OpenGPT模型與Agent榜單背後的證據狀態,包括來源資料日、最近檢查與發布控制。

狀態政策更新

01

模型榜單來源

即時監測狀態來自公開狀態介面;來源資料日與檢查時間分開顯示。

來源證據狀態來源資料日最近檢查發布控制
正在讀取即時狀態
驗證通過後自動發布
Artificial Analysis開啟來源
正在讀取即時狀態
來源未公布
人工審核後發布
正在讀取即時狀態
人工審核後發布

02

Agent評測來源

這裡顯示已發布證據及其最近一次記錄的檢查,不代表來源網站或產品在線。

來源證據狀態來源資料日最近檢查發布控制
SWE-bench Verified開啟來源
歷史快照
人工審核後發布
Terminal-Bench 2.1開啟來源
已發布快照
人工審核後發布
AssistantBench開啟來源
歷史快照
來源未公布
人工審核後發布
來源需要複核
來源未公布
人工審核後發布
OSWorld 2.0開啟來源
已發布快照
人工審核後發布
Berkeley Function-Calling Leaderboard開啟來源
歷史快照
人工審核後發布
歷史快照
來源未公布
人工審核後發布
τ²-bench Core開啟來源
已發布快照
來源未公布
人工審核後發布
τ³-Banking Knowledge開啟來源
已發布快照
人工審核後發布

03

服務邊界

每個狀態只說明這裡明確列出的流程,不能理解為更廣泛的可用性承諾。

公開榜單

OpenGPT發布來源快照與目錄記錄,不持續檢測服務商API、模型端點、價格或地區可用性。

來源監測

系統依標示的週期檢查已設定的上游資料;一次檢查成功不能證明每個來源頁面、模型或API都可用。

本機決策工具

收藏、工作輸入與報告預設儲存在目前瀏覽器;本頁狀態不代表雲端同步或資料復原。

提交與郵件

提交會進入編輯審核。提交確認與最終結果郵件透過交易佇列傳送,不承諾即時送達或固定審核時間。

04

發布決定如何產生

收集、審核、目錄收錄、可比性與榜單排名始終是不同決定。

01

驗證後自動發布

只有LMArena符合條件,而且必須通過結構、完整性、日期與異常檢查;驗證失敗時不會發布。

02

人工來源審核

Artificial Analysis、LiveBench與Agent來源在改變公開證據前,都需要人工審核。

03

使用者提交

審核通過可讓Agent產品進入公開目錄,但不會設定排名、可比資格或證據等級,也不保證進入榜單。

05

方法與更正

查看比較規則,或回報錯誤的日期、身分對應、連結和證據標籤。