OPENGPT 證據協定 V1

模型選擇是否可信,取決於證據是否可信。

OpenGPT 將需求匹配、親自比較與公開證據分開。每個結論都應說明測試內容、測試條件,以及哪些部分仍未驗證。

從真實工作到可複核結論

1

先凍結問題

比較前記錄工作、成功標準、輸入、限制、模型版本、日期與設定。

2

在相同條件下執行

所有候選使用同一工作與評分標準。需要盲測偏好時,請使用外部隨機化工具;目前私密比較不會隱藏模型名稱。

3

保留原始證據

保存提示詞、輸出、評分、錯誤、延遲與雜湊;缺少的證據不能用估算補齊。

4

公開結論邊界

說明不確定性、樣本量、排除項目、利益關係,以及結果無法證明什麼。

證據等級目標標準

目前本機核驗器完整支援 L1,只能部分檢查 L2 的聲明;L3 與 L4 尚不能核驗。以下等級是協定目標,不是對上傳檔案的自動認證。

L1現已支援

格式通過

檔案符合聲明的 Schema,且沒有明顯的金鑰欄位。

L2部分支援

協定一致

目標是完整記錄工作集、設定、模型聲明與評測日期;V1 目前只檢查部分聲明。

L3尚未支援

可以重算

目標是包含足夠的原始輸出與評分輸入,供第三方重新計算;V1 目前沒有這些欄位。

L4尚未支援

獨立重現

目標是由獨立執行方或簽署來源在可比條件下重現結果;V1 目前不能核驗。

本機核驗能確認什麼

  • 必填欄位與支援的資料型別
  • 評分、執行記錄、日期與雜湊的內部一致性
  • 檔案是否聲明為示範資料
  • 沒有常見 API 金鑰與敏感欄位

單靠本機核驗無法確認什麼

  • 聲明的服務商或模型是否真的產生輸出
  • 評分是否沒有選擇偏差或薄弱測試設計
  • 一次結果是否適用於所有工作、語言、使用者與未來版本
  • 模型是否適合高風險、安全或法律相關決策

公開原則

不出售排名

贊助可以揭露,但不能改變評分、證據門檻或展示位置。

比較版本,不比較品牌口號

模型系列不是穩定的測試對象,必須記錄準確模型 ID、設定、地區與日期。

先測真實工作,再做廣泛結論

OpenGPT 先依需求縮小候選,再讓使用者以自己的代表性工作驗證。

不確定也是結果

平手、小樣本、失敗執行與無法下結論的證據都應保留。