模型選擇是否可信,取決於證據是否可信。
OpenGPT 將需求匹配、親自比較與公開證據分開。每個結論都應說明測試內容、測試條件,以及哪些部分仍未驗證。
從真實工作到可複核結論
先凍結問題
比較前記錄工作、成功標準、輸入、限制、模型版本、日期與設定。
在相同條件下執行
所有候選使用同一工作與評分標準。需要盲測偏好時,請使用外部隨機化工具;目前私密比較不會隱藏模型名稱。
保留原始證據
保存提示詞、輸出、評分、錯誤、延遲與雜湊;缺少的證據不能用估算補齊。
公開結論邊界
說明不確定性、樣本量、排除項目、利益關係,以及結果無法證明什麼。
證據等級目標標準
目前本機核驗器完整支援 L1,只能部分檢查 L2 的聲明;L3 與 L4 尚不能核驗。以下等級是協定目標,不是對上傳檔案的自動認證。
格式通過
檔案符合聲明的 Schema,且沒有明顯的金鑰欄位。
協定一致
目標是完整記錄工作集、設定、模型聲明與評測日期;V1 目前只檢查部分聲明。
可以重算
目標是包含足夠的原始輸出與評分輸入,供第三方重新計算;V1 目前沒有這些欄位。
獨立重現
目標是由獨立執行方或簽署來源在可比條件下重現結果;V1 目前不能核驗。
本機核驗能確認什麼
- ✓必填欄位與支援的資料型別
- ✓評分、執行記錄、日期與雜湊的內部一致性
- ✓檔案是否聲明為示範資料
- ✓沒有常見 API 金鑰與敏感欄位
單靠本機核驗無法確認什麼
- —聲明的服務商或模型是否真的產生輸出
- —評分是否沒有選擇偏差或薄弱測試設計
- —一次結果是否適用於所有工作、語言、使用者與未來版本
- —模型是否適合高風險、安全或法律相關決策
公開原則
不出售排名
贊助可以揭露,但不能改變評分、證據門檻或展示位置。
比較版本,不比較品牌口號
模型系列不是穩定的測試對象,必須記錄準確模型 ID、設定、地區與日期。
先測真實工作,再做廣泛結論
OpenGPT 先依需求縮小候選,再讓使用者以自己的代表性工作驗證。
不確定也是結果
平手、小樣本、失敗執行與無法下結論的證據都應保留。