公開一項推薦如何成為決策。
OpenGPT是AI決策工作區。我們將編輯需求匹配、事實來源、真實工作評測與公開基準證據分開,讓每個結果都能說明條件與邊界。
一分鐘看懂方法
- 名次只代表模型在某個來源與範圍內的相對位置,不是萬用總分。
- 比較對象必須是具體模型版本或完整Agent設定。
- 缺漏或不可比較的資料繼續標示為未知,不會變成 0 或強行合併排名。
- 本機報告核驗可確認結構與內部一致性,不能證明輸出來源或服務商真實性。
編輯適用分 · editorial-fit-v1
0–10編輯適用分如何產生
八個目錄訊號用於逐面向比較。它們是獨立記錄的OpenGPT編輯判斷層,與rules-v2推薦加分和公共基準證據分開。
編輯產品適用分:10表示更符合所列面向;各面向同等顯示,絕不合併成總冠軍。
綜合能力
0–10依公開能力、目錄角色和已知產品限制,編輯判斷其對廣泛複雜工作的適用性;不是智商或基準分數。
程式設計
0–10編輯判斷其對軟體規劃、實作、除錯、審查和程式庫工作的適用性;不是實測通過率。
推理
0–10編輯判斷其對多步分析、限制處理和結構化解題的適用性;不是重現後的推理基準。
寫作
0–10編輯判斷其對起草、編輯、長文與文件工作的適用性;不是文風或事實性的實測結果。
速度
0–10依產品定位和交付方式編輯判斷其快速迭代適用性;不是實測延遲主張。
成本效率
0–10依標示級距和部署方式編輯判斷其價格與營運成本可控性;不是總成本計算或價格保證。
隱私控制
0–10依本機、混合或雲端分類編輯判斷其部署與資料控制適用性;不是安全、合規或遙測稽核。
生態
0–10編輯判斷其對可用工具、整合、平台和部署選項的適用性;不是市場占有率或整合品質實測。
權重與彙總
各面向的顯示權重相同,但沒有算術權重、平均分、總分或總冠軍;使用者依聲明條件決定哪些面向重要。
人工編輯判斷界線
編輯依rubric、服務商確認的產品事實和目錄分類給出0–10整數。它不是具體版本實測、基準結果、機率或服務商保證。
來源
服務商官方頁面支援身分、存取、公開能力、部署選項和標示價格;適用標籤、優勢、弱點、分類及全部0–10分均屬OpenGPT編輯輸入。
目錄審閱
目錄最後審閱:
信賴度: 編輯涵蓋完整度:中
信賴度描述目錄涵蓋與解釋的完整性,不表示表現良好的機率。服務商事實可能變化,適用訊號也沒有經過獨立實測。
適用範圍
用於在目前產品與部署假設下,依具名面向比較目錄記錄;不要把分差視為實測效能差異。
採用前,請核實目前服務商事實,並測試具體模型版本、服務級距、工具、地區與代表性真實工作。
公開方法 · rules-v2
OpenGPT如何產生推薦
AI組合建立器把本機AI資料轉成確定性候選清單。以下分數在預算和隱私硬門檻之後排列編輯產品匹配度,並不衡量模型品質。
評分維度與加分規則
分數是條件權重,不是百分比;硬門檻會在評分前排除不合格項目。
工作與目標匹配
模型 · 工具模型每符合一個所選工作加12分,精確符合目標加10分;工具每符合一個用途加10分。
使用者聲明條件 · OpenGPT編輯目錄隱私與部署
模型 · 工具高隱私會排除非本機模型及非高隱私工具;合格本機模型加30分、高隱私工具加12分。中等隱私下,混合/本機/雲端模型分別加8/5/2分。
使用者聲明條件 · OpenGPT編輯目錄預算資格
模型 · 工具超出所選標示價格範圍的項目會被排除;合格模型加12分、工具加8分,免費檔且標有免費入口的模型再加16分。
使用者聲明條件 · 服務商公開事實 · OpenGPT編輯目錄職業匹配
模型 · 工具學生與模型符合加10分,其他已支援的模型職業符合加8分;學生與工具符合加8分,其他工具職業符合加6分。
使用者聲明條件 · OpenGPT編輯目錄產業訊號
模型 · 工具辨識出的產業詞會對應為工作類別;模型每項符合加5分、工具加4分,自由文字本身不會複製進工作流程。
使用者聲明條件 · OpenGPT編輯目錄語言匹配
模型偏好非英語時,多語言目錄符合加14分,不符合減3分;偏好英語時,寫作或文件符合加3分。
使用者聲明條件 · OpenGPT編輯目錄平台匹配
模型 · 工具模型符合權重為網頁+3、桌面+10、終端+8、API+7、行動端+9;工具每個平台符合加7分,無符合減3分。
使用者聲明條件 · OpenGPT編輯目錄經驗匹配
模型 · 工具入門模型符合加10分(本機模型不符合減4分),進階符合加7分,中階的前沿/混合模型符合加2分;入門/進階工具符合分別加6/5分。
使用者聲明條件 · OpenGPT編輯目錄選擇與同分
模型 · 工具合格候選按規則分排序,同分按名稱排序;角色按固定順序填入,剩餘符合模型最多取三個作為替代項。
確定性rules-v2來源與主張邊界
服務商公開事實
官方頁面用於支持身分、存取方式、公開能力描述和標示價格;OpenGPT不把它們視為獨立效能測試。
OpenGPT編輯目錄
適用標籤、優勢、隱私/部署分類和產品匹配訊號屬於經審閱的編輯判斷,不是基準實測或服務商保證。
使用者聲明條件
目標、工作、職業、預算、隱私、語言、平台、經驗和產業訊號來自使用者本機資料,屬於適用條件,不是外部證據。
確定性rules-v2
相同的標準化資料和目錄快照會產生相同排序;計算可解釋,但確定性不會把編輯輸入變成事實。
公開基準背景
公開榜單是獨立證據;rules-v2 不把基準名次或分數加入推薦分,應在篩選後依各來源範圍查看。
事實與編輯判斷
事實主張必須能追溯到具名服務商或基準來源、可用時的精確身分和審閱日期。
適用標籤、優勢、分類、假設、信賴度和推薦屬於OpenGPT編輯判斷,不得包裝成具體版本的實測結果。
審閱週期與信賴度
方法與有效推薦記錄計畫至少每90天審閱一次,發生重大變化時也會觸發審閱。每個結果必須使用自身記錄的審閱日期,而不是本頁日期。
以下情況觸發審閱
- 服務商更改模型ID、生命週期、存取方式、能力說明或標示價格時。
- 推薦引擎、權重、硬門檻或編輯分類發生變化時。
- 更正發現重要來源、身分、價格、隱私或適用性錯誤時。
信賴度規則
信賴度描述匹配解釋及其支援記錄的完整性,不表示模型表現良好的機率。
- 高
- 有精確身分和目前事實來源,重要欄位已核實,假設已顯示,並提供合格替代項。
- 中
- 匹配理由可解釋,但採用前仍需確認至少一個來源、條件或目前事實。
- 低
- 身分、時效、價格、隱私或適用性存在重要缺口,只能作為待調查候選。
適用範圍與條件
- 適用於rules-v2依目前已審閱模型與工具目錄產生的編輯候選。
- 結果取決於提交的資料和目錄快照,任一變化都可能改變結果。
- 它是低風險決策輔助,不證明品質、即時價格、基準領先、安全性、合法性或受監管用途適配。
每個結果必須顯示的稽核資訊
整合後的推薦必須顯示以下七項,讓使用者無需猜測證據邊界。
- 推薦理由
- 證據
- 假設
- 最後審閱
- 信賴度
- 最佳替代項
- 何時不應選擇
從真實工作到可複核結論
明確評測條件
比較前記錄工作、成功標準、輸入、限制、具體模型版本、設定與日期。
使用相同條件
所有候選使用相同工作與評分標準。隱藏模型名稱可減少名稱偏差,但並非雙盲或獨立執行。
保留原始資料
保存提示詞、回答、評分、錯誤、延遲與雜湊;缺少資料不以估算補齊。
說明結果邊界
公開不確定性、樣本量、排除項目、利益關係,以及結果無法證明什麼。
證據等級
Evidence v1/v2 檢查檔案格式與聲明是否一致;「決策工作台」V3 還會依已保存的輸入重算雜湊、分配、映射、評分與彙總,但不能證明L4 獨立重現。
格式檢查通過
檔案符合聲明的Schema,且沒有明顯的金鑰欄位。
記錄完整
工作集、設定、模型資訊與評測日期應完整一致;V1 目前只能檢查其中一部分。
結果可重算
「決策工作台」V3 保存原始回答與評分輸入,可在本機嚴格重算;Evidence v1/v2 不含同等欄位。
獨立重現
目標是由獨立執行方或簽署來源在可比條件下重現結果;V1 目前不能核驗。
AI Agent榜單如何比較
每一列代表一個公開Agent設定在指定評測範圍內的成績,不能視為基礎模型本身的分數。
比較系統設定
保留來源公開的Agent、基礎模型、執行框架、工具、環境、預算與日期;未公開的欄位保持未知。
保留原始量尺
只在相同基準、版本、工作規則與可比執行群組內排名,不產生跨基準的萬用總分。
標明資料狀態
區分基準官方榜單記錄、上游核查提交、服務商報告與社群執行。
保留營運資料
來源提供可比資料時顯示成本、延遲、步驟數與人工介入;缺漏值繼續保持未知。
本機核驗能確認什麼
- ✓必填欄位與支援的資料型別
- ✓評分、執行記錄、日期與雜湊的內部一致性
- ✓檔案是否聲明為示範資料
- ✓沒有常見API金鑰與敏感欄位
單靠本機核驗無法確認什麼
- —聲明的服務商或模型是否真的產生輸出
- —評分是否沒有選擇偏差或薄弱測試設計
- —一次結果是否適用於所有工作、語言、使用者與未來版本
- —模型是否適合高風險、安全或法律相關決策
公開原則
不出售排名
贊助可以揭露,但不能改變評分、證據門檻或展示位置。
比較版本,而非品牌
模型系列會持續變化,評測時必須記錄準確的模型ID、設定、地區與日期。
先測真實工作,再做廣泛結論
OpenGPT先依需求縮小候選,再讓使用者以自己的代表性工作驗證。
不確定也是結果
平手、小樣本、失敗執行與無法下結論的證據都應保留。