指南與支援

OpenGPT 說明中心

選擇指南、依步驟操作,或搜尋遇到的問題。

從這裡開始:三個不同作用

選擇、比較與核驗支援不同的決策,它們都不是通用排行榜。

1選擇依你的要求縮小模型家族候選範圍。2比較以相同工作比較準確模型版本的真實回答。3核驗檢查證據檔案的結構與內部一致性。

01

選擇 AI 模型

把 4 個實際要求轉為可解釋的候選名單。

進入這項功能

這項功能用來做什麼

當你知道要完成什麼工作,卻不知道先研究哪個模型家族時,使用模型選擇助手。

開始之前

先整理主要工作、允許的部署位置、最重要的營運偏好,以及語言需求。

逐步教學

  1. 1選擇最接近真實工作的工作,而不是最寬泛的選項。
  2. 2設定部署邊界;資料不能離開公司或裝置時尤其重要。
  3. 3選擇最不能妥協的優先事項,例如隱私、效率或工具生態。
  4. 4設定語言需求,並同時閱讀候選的符合理由、風險與下一步驗證。
  5. 5把最合適的候選帶到「比較」,以相同工作測試準確的模型版本。

如何理解結果

定性符合標籤與符合項目數量僅適用於模型系列,不代表具體版本表現或基準分數。請確認所列目前版本的部署可用性,並以相同工作比較。

它不能證明什麼

選擇助手不會呼叫模型、核對即時價格,也不會提供適合所有人的冠軍。同一模型家族的不同版本可能差異很大。

常見問題: 為什麼知名模型沒有排第一?

排序依據是你選擇的限制條件,不是知名度。可修改一項條件觀察變化,再用真實工作比較具體版本。

返回頂端
02

比較兩個模型

無需向 OpenGPT 提供 API 金鑰,在本機記錄公平的同題比較。

進入這項功能

這項功能用來做什麼

使用 3 套內建實務測試中的一套,比較兩個準確的模型版本。

開始之前

你需要自行開啟兩個模型服務,確認準確版本與設定,移除敏感資料,並注意服務商會收到提示詞且可能收費。

逐步教學

  1. 1選擇兩個不同的準確模型版本。
  2. 2從 3 套內建工作範本中選擇一套。
  3. 3開啟各服務商連結,不修改提示詞,在兩個模型中分別執行。
  4. 4完整貼上兩個回答,並從事實正確、指令遵循、完整性、安全性與表達清楚度進行判斷。
  5. 5完成全部測試,檢查未完成項目,並下載保存在本機的比較報告。

如何理解結果

勝負與平手只彙總本次工作階段已完成的測試。請在備註記錄選擇理由,它是理解結果的重要證據。

它不能證明什麼

OpenGPT 不呼叫模型、不核驗回答來源、不隱藏候選標籤,目前也不支援自訂提示詞。少量人工測試不能代表通用排行榜。

常見問題: 兩個回答都有問題時怎麼選?

若沒有明確較好的回答,請選擇平手並記錄各自問題。證據不足時不要勉強選出勝者。

返回頂端
03

核驗證據或比較報告

檢查支援 JSON 的結構、內部一致性、金鑰風險模式與本機指紋。

進入這項功能

這項功能用來做什麼

可以核驗 OpenGPT Evidence v1/v2 證據包,也能核驗從「本機比較」下載的報告。全部檢查都在目前瀏覽器本機完成。

開始之前

取得原始 JSON 檔案。比較報告應從「本機比較」下載;若需要完整結果而非草稿,請先完成全部測試。

逐步教學

  1. 1選擇 JSON 檔案;內容只在目前瀏覽器處理,不會上傳。
  2. 2確認工具將它識別為 Evidence v1/v2,或 OpenGPT 本機比較協定 v1/v2。
  3. 3對證據包,檢查必填欄位、執行記錄、時間、分數與金鑰安全規則;對比較報告,檢查候選名稱、工作範本、草稿或完成狀態、測試是否重複,以及彙總是否與已記錄的判斷一致。
  4. 4閱讀檔案聲明的摘要;若日後需要確認審閱的是同一檔案,請保存 SHA-256 本機指紋。
  5. 5若檢查失敗,應修正來源資料或完成缺少的比較測試,不要直接修改下載檔案來強行通過。

如何理解結果

對 Evidence v1/v2,「通過」代表檔案符合支援的結構與一致性規則,「展示」代表它是範例。對比較報告,「通過」代表完整報告內部一致;「草稿」代表結構有效,但比較尚未完成。「失敗」代表至少一個必查項目需要處理。

它不能證明什麼

檢查通過不能證明所填模型確實產生了貼上的回答、服務商聲明為真,也不能證明結果適用於已記錄測試以外的工作。不同檔案的結果不能自動比較。

常見問題: 比較報告通過後,是否證明某個模型較好?

不能。它只確認支援報告的結構有效且內部一致。你仍需判斷模型身分、測試品質、回答內容及結果是否適用於真實決策。

返回頂端
04

瀏覽模型

在比較具體版本前,先了解模型家族。

進入這項功能

這項功能用來做什麼

在模型頁面了解模型家族的官方定位、常見優勢、已知取捨與適用工作。

開始之前

帶著一項真實工作或關鍵限制來查看。只有模型家族名稱,不足以支持採購或部署決定。

逐步教學

  1. 1依模型名稱、優勢、限制或工作搜尋。
  2. 2閱讀頁面中已顯示的模型資料,同時查看優勢與限制。
  3. 3查看適用工作,並開啟官方資料核對原始表述。
  4. 4從已展開的版本清單中選擇兩個準確版本。
  5. 5點選「比較所選版本」,把兩個候選帶入同題比較。

如何理解結果

模型資料用來協助形成可驗證的判斷假設,並不是獨立量測的模型能力。

它不能證明什麼

服務商主張與模型家族描述未必適用所有版本。可用性、價格、隱私與限制需要直接核對。

常見問題: 只看模型頁面就能決定嗎?

可用它建立候選名單;若決定會影響成本、客戶或資料安全,還要用自己的工作比較準確版本。

返回頂端
05

理解評測方法

了解什麼樣的模型選擇過程可以檢查與重現。

進入這項功能

這項功能用來做什麼

在設計、公開或依賴模型評測前使用,避免把模型知名度誤當成證據品質。

開始之前

準備具體決策問題、準確的模型版本、具代表性的工作,以及保存原始回答的計畫。

逐步教學

  1. 1在查看結果前,寫清楚決策問題與成功標準。
  2. 2對所有候選使用相同工作、設定與評分規則。
  3. 3保留提示詞、原始回答、設定、失敗記錄、時間與工作集指紋。
  4. 4說明哪些環節是人工、自動、盲測、隨機順序或獨立重現。
  5. 5結論必須同時說明不確定性與不能證明的內容。

如何理解結果

證據等級是目標標準。目前支援 L1,L2 僅部分支援;L3–L4 需要目前本機流程以外的能力。

它不能證明什麼

嚴謹流程可減少偏差,但不能保證樣本代表所有使用者、語言、未來模型版本或正式環境。

常見問題: 一定要使用最高證據等級嗎?

依決策後果選擇。個人試用可能只需 L1;公開或高風險主張應尋求更強的獨立證據。

返回頂端

簡明術語表

遇到不熟悉的標籤時,可在這裡快速查看。

需求符合度
模型系列的定性符合標籤與符合項目數量,不用於評價具體版本。請確認所列目前版本的部署可用性,並以相同工作比較。
模型家族
一組相關模型版本;不同版本的能力可能不同。
基準評測
在明確條件下,使用可重複工作與評分規則比較系統。
證據檔案
說明評測如何執行、觀察到什麼的結構化記錄。
Schema 格式規範
規定檔案必填欄位與允許值的機器可讀規則。
SHA-256 指紋
識別完全相同檔案內容的本機編號;檔案改變時指紋也會改變。

常見問題排查

沒有模型符合全部要求

查看各候選被排除的原因,只放寬真正可調整的條件。

檢查需求

找不到準確版本

在模型頁面檢查版本清單與官方資料,不要以模型家族名稱代替準確版本。

檢查模型版本

比較報告顯示未完成

返回所有標記的測試,補充兩個完整回答並選擇判斷結果。

繼續比較

本機草稿衝突或需要重設

返回比較頁面,查看較新草稿提示,再明確選擇保留或重設。

檢查本機草稿

證據檔案檢查失敗

依失敗項目修正來源記錄。不要加入金鑰,也不要為了通過而改寫結果。

開啟核驗工具
contact@opengpt.com

仍需協助?

歡迎回報失效連結、錯誤的模型資訊或尚未解決的問題。

傳送電子郵件