OPENGPT 評測方法

先看證據,再相信結果。

OpenGPT 將需求匹配、真實工作評測與公開資料分開呈現。每個結果都會說明測試內容、條件,以及哪些部分仍待核實。

一分鐘看懂方法

  • 名次只代表模型在某個來源與範圍內的相對位置,不是萬用總分。
  • 比較對象必須是具體模型版本或完整 Agent 設定。
  • 缺漏或不可比較的資料繼續標示為未知,不會變成 0 或強行合併排名。
  • 本機報告核驗可確認結構與內部一致性,不能證明輸出來源或服務商真實性。

從真實工作到可複核結論

1

明確評測條件

比較前記錄工作、成功標準、輸入、限制、具體模型版本、設定與日期。

2

使用相同條件

所有候選使用相同工作與評分標準。隱藏模型名稱可減少名稱偏差,但並非雙盲或獨立執行。

3

保留原始資料

保存提示詞、回答、評分、錯誤、延遲與雜湊;缺少資料不以估算補齊。

4

說明結果邊界

公開不確定性、樣本量、排除項目、利益關係,以及結果無法證明什麼。

證據等級

Evidence v1/v2 檢查檔案格式與聲明是否一致;「決策工作台」V3 還會依已保存的輸入重算雜湊、分配、映射、評分與彙總,但不能證明 L4 獨立重現。

L1現已支援

格式檢查通過

檔案符合聲明的 Schema,且沒有明顯的金鑰欄位。

L2部分支援

記錄完整

工作集、設定、模型資訊與評測日期應完整一致;V1 目前只能檢查其中一部分。

L3V3 已支援

結果可重算

「決策工作台」V3 保存原始回答與評分輸入,可在本機嚴格重算;Evidence v1/v2 不含同等欄位。

L4尚未支援

獨立重現

目標是由獨立執行方或簽署來源在可比條件下重現結果;V1 目前不能核驗。

AI Agent 榜單如何比較

每一列代表一個公開 Agent 設定在指定評測範圍內的成績,不能視為基礎模型本身的分數。

比較系統設定

保留來源公開的 Agent、基礎模型、執行框架、工具、環境、預算與日期;未公開的欄位保持未知。

保留原始量尺

只在相同基準、版本、工作規則與可比執行群組內排名,不產生跨基準的萬用總分。

標明資料狀態

區分基準官方榜單記錄、上游核查提交、服務商報告與社群執行。

保留營運資料

來源提供可比資料時顯示成本、延遲、步驟數與人工介入;缺漏值繼續保持未知。

本機核驗能確認什麼

  • 必填欄位與支援的資料型別
  • 評分、執行記錄、日期與雜湊的內部一致性
  • 檔案是否聲明為示範資料
  • 沒有常見 API 金鑰與敏感欄位

單靠本機核驗無法確認什麼

  • 聲明的服務商或模型是否真的產生輸出
  • 評分是否沒有選擇偏差或薄弱測試設計
  • 一次結果是否適用於所有工作、語言、使用者與未來版本
  • 模型是否適合高風險、安全或法律相關決策

公開原則

不出售排名

贊助可以揭露,但不能改變評分、證據門檻或展示位置。

比較版本,而非品牌

模型系列會持續變化,評測時必須記錄準確的模型 ID、設定、地區與日期。

先測真實工作,再做廣泛結論

OpenGPT 先依需求縮小候選,再讓使用者以自己的代表性工作驗證。

不確定也是結果

平手、小樣本、失敗執行與無法下結論的證據都應保留。