先看證據,再相信結果。
OpenGPT 將需求匹配、真實工作評測與公開資料分開呈現。每個結果都會說明測試內容、條件,以及哪些部分仍待核實。
一分鐘看懂方法
- 名次只代表模型在某個來源與範圍內的相對位置,不是萬用總分。
- 比較對象必須是具體模型版本或完整 Agent 設定。
- 缺漏或不可比較的資料繼續標示為未知,不會變成 0 或強行合併排名。
- 本機報告核驗可確認結構與內部一致性,不能證明輸出來源或服務商真實性。
從真實工作到可複核結論
明確評測條件
比較前記錄工作、成功標準、輸入、限制、具體模型版本、設定與日期。
使用相同條件
所有候選使用相同工作與評分標準。隱藏模型名稱可減少名稱偏差,但並非雙盲或獨立執行。
保留原始資料
保存提示詞、回答、評分、錯誤、延遲與雜湊;缺少資料不以估算補齊。
說明結果邊界
公開不確定性、樣本量、排除項目、利益關係,以及結果無法證明什麼。
證據等級
Evidence v1/v2 檢查檔案格式與聲明是否一致;「決策工作台」V3 還會依已保存的輸入重算雜湊、分配、映射、評分與彙總,但不能證明 L4 獨立重現。
格式檢查通過
檔案符合聲明的 Schema,且沒有明顯的金鑰欄位。
記錄完整
工作集、設定、模型資訊與評測日期應完整一致;V1 目前只能檢查其中一部分。
結果可重算
「決策工作台」V3 保存原始回答與評分輸入,可在本機嚴格重算;Evidence v1/v2 不含同等欄位。
獨立重現
目標是由獨立執行方或簽署來源在可比條件下重現結果;V1 目前不能核驗。
AI Agent 榜單如何比較
每一列代表一個公開 Agent 設定在指定評測範圍內的成績,不能視為基礎模型本身的分數。
比較系統設定
保留來源公開的 Agent、基礎模型、執行框架、工具、環境、預算與日期;未公開的欄位保持未知。
保留原始量尺
只在相同基準、版本、工作規則與可比執行群組內排名,不產生跨基準的萬用總分。
標明資料狀態
區分基準官方榜單記錄、上游核查提交、服務商報告與社群執行。
保留營運資料
來源提供可比資料時顯示成本、延遲、步驟數與人工介入;缺漏值繼續保持未知。
本機核驗能確認什麼
- ✓必填欄位與支援的資料型別
- ✓評分、執行記錄、日期與雜湊的內部一致性
- ✓檔案是否聲明為示範資料
- ✓沒有常見 API 金鑰與敏感欄位
單靠本機核驗無法確認什麼
- —聲明的服務商或模型是否真的產生輸出
- —評分是否沒有選擇偏差或薄弱測試設計
- —一次結果是否適用於所有工作、語言、使用者與未來版本
- —模型是否適合高風險、安全或法律相關決策
公開原則
不出售排名
贊助可以揭露,但不能改變評分、證據門檻或展示位置。
比較版本,而非品牌
模型系列會持續變化,評測時必須記錄準確的模型 ID、設定、地區與日期。
先測真實工作,再做廣泛結論
OpenGPT 先依需求縮小候選,再讓使用者以自己的代表性工作驗證。
不確定也是結果
平手、小樣本、失敗執行與無法下結論的證據都應保留。