AI決策工作區方法

公開一項推薦如何成為決策。

OpenGPT是AI決策工作區。我們將編輯需求匹配、事實來源、真實工作評測與公開基準證據分開,讓每個結果都能說明條件與邊界。

一分鐘看懂方法

  • 名次只代表模型在某個來源與範圍內的相對位置,不是萬用總分。
  • 比較對象必須是具體模型版本或完整Agent設定。
  • 缺漏或不可比較的資料繼續標示為未知,不會變成 0 或強行合併排名。
  • 本機報告核驗可確認結構與內部一致性,不能證明輸出來源或服務商真實性。

編輯適用分 · editorial-fit-v1

0–10編輯適用分如何產生

八個目錄訊號用於逐面向比較。它們是獨立記錄的OpenGPT編輯判斷層,與rules-v2推薦加分和公共基準證據分開。

編輯產品適用分:10表示更符合所列面向;各面向同等顯示,絕不合併成總冠軍。

綜合能力

0–10

依公開能力、目錄角色和已知產品限制,編輯判斷其對廣泛複雜工作的適用性;不是智商或基準分數。

程式設計

0–10

編輯判斷其對軟體規劃、實作、除錯、審查和程式庫工作的適用性;不是實測通過率。

推理

0–10

編輯判斷其對多步分析、限制處理和結構化解題的適用性;不是重現後的推理基準。

寫作

0–10

編輯判斷其對起草、編輯、長文與文件工作的適用性;不是文風或事實性的實測結果。

速度

0–10

依產品定位和交付方式編輯判斷其快速迭代適用性;不是實測延遲主張。

成本效率

0–10

依標示級距和部署方式編輯判斷其價格與營運成本可控性;不是總成本計算或價格保證。

隱私控制

0–10

依本機、混合或雲端分類編輯判斷其部署與資料控制適用性;不是安全、合規或遙測稽核。

生態

0–10

編輯判斷其對可用工具、整合、平台和部署選項的適用性;不是市場占有率或整合品質實測。

權重與彙總

各面向的顯示權重相同,但沒有算術權重、平均分、總分或總冠軍;使用者依聲明條件決定哪些面向重要。

人工編輯判斷界線

編輯依rubric、服務商確認的產品事實和目錄分類給出0–10整數。它不是具體版本實測、基準結果、機率或服務商保證。

來源

服務商官方頁面支援身分、存取、公開能力、部署選項和標示價格;適用標籤、優勢、弱點、分類及全部0–10分均屬OpenGPT編輯輸入。

目錄審閱

目錄最後審閱:

信賴度: 編輯涵蓋完整度:中

信賴度描述目錄涵蓋與解釋的完整性,不表示表現良好的機率。服務商事實可能變化,適用訊號也沒有經過獨立實測。

適用範圍

用於在目前產品與部署假設下,依具名面向比較目錄記錄;不要把分差視為實測效能差異。

採用前,請核實目前服務商事實,並測試具體模型版本、服務級距、工具、地區與代表性真實工作。

公開方法 · rules-v2

OpenGPT如何產生推薦

AI組合建立器把本機AI資料轉成確定性候選清單。以下分數在預算和隱私硬門檻之後排列編輯產品匹配度,並不衡量模型品質。

評分維度與加分規則

分數是條件權重,不是百分比;硬門檻會在評分前排除不合格項目。

工作與目標匹配

模型 · 工具

模型每符合一個所選工作加12分,精確符合目標加10分;工具每符合一個用途加10分。

使用者聲明條件 · OpenGPT編輯目錄

隱私與部署

模型 · 工具

高隱私會排除非本機模型及非高隱私工具;合格本機模型加30分、高隱私工具加12分。中等隱私下,混合/本機/雲端模型分別加8/5/2分。

使用者聲明條件 · OpenGPT編輯目錄

預算資格

模型 · 工具

超出所選標示價格範圍的項目會被排除;合格模型加12分、工具加8分,免費檔且標有免費入口的模型再加16分。

使用者聲明條件 · 服務商公開事實 · OpenGPT編輯目錄

職業匹配

模型 · 工具

學生與模型符合加10分,其他已支援的模型職業符合加8分;學生與工具符合加8分,其他工具職業符合加6分。

使用者聲明條件 · OpenGPT編輯目錄

產業訊號

模型 · 工具

辨識出的產業詞會對應為工作類別;模型每項符合加5分、工具加4分,自由文字本身不會複製進工作流程。

使用者聲明條件 · OpenGPT編輯目錄

語言匹配

模型

偏好非英語時,多語言目錄符合加14分,不符合減3分;偏好英語時,寫作或文件符合加3分。

使用者聲明條件 · OpenGPT編輯目錄

平台匹配

模型 · 工具

模型符合權重為網頁+3、桌面+10、終端+8、API+7、行動端+9;工具每個平台符合加7分,無符合減3分。

使用者聲明條件 · OpenGPT編輯目錄

經驗匹配

模型 · 工具

入門模型符合加10分(本機模型不符合減4分),進階符合加7分,中階的前沿/混合模型符合加2分;入門/進階工具符合分別加6/5分。

使用者聲明條件 · OpenGPT編輯目錄

選擇與同分

模型 · 工具

合格候選按規則分排序,同分按名稱排序;角色按固定順序填入,剩餘符合模型最多取三個作為替代項。

確定性rules-v2

來源與主張邊界

事實來源

服務商公開事實

官方頁面用於支持身分、存取方式、公開能力描述和標示價格;OpenGPT不把它們視為獨立效能測試。

編輯判斷

OpenGPT編輯目錄

適用標籤、優勢、隱私/部署分類和產品匹配訊號屬於經審閱的編輯判斷,不是基準實測或服務商保證。

使用者聲明條件

使用者聲明條件

目標、工作、職業、預算、隱私、語言、平台、經驗和產業訊號來自使用者本機資料,屬於適用條件,不是外部證據。

機械規則

確定性rules-v2

相同的標準化資料和目錄快照會產生相同排序;計算可解釋,但確定性不會把編輯輸入變成事實。

僅供背景

公開基準背景

公開榜單是獨立證據;rules-v2 不把基準名次或分數加入推薦分,應在篩選後依各來源範圍查看。

事實與編輯判斷

事實來源

事實主張必須能追溯到具名服務商或基準來源、可用時的精確身分和審閱日期。

編輯判斷

適用標籤、優勢、分類、假設、信賴度和推薦屬於OpenGPT編輯判斷,不得包裝成具體版本的實測結果。

審閱週期與信賴度

方法與有效推薦記錄計畫至少每90天審閱一次,發生重大變化時也會觸發審閱。每個結果必須使用自身記錄的審閱日期,而不是本頁日期。

以下情況觸發審閱

  • 服務商更改模型ID、生命週期、存取方式、能力說明或標示價格時。
  • 推薦引擎、權重、硬門檻或編輯分類發生變化時。
  • 更正發現重要來源、身分、價格、隱私或適用性錯誤時。

信賴度規則

信賴度描述匹配解釋及其支援記錄的完整性,不表示模型表現良好的機率。

有精確身分和目前事實來源,重要欄位已核實,假設已顯示,並提供合格替代項。
匹配理由可解釋,但採用前仍需確認至少一個來源、條件或目前事實。
身分、時效、價格、隱私或適用性存在重要缺口,只能作為待調查候選。

適用範圍與條件

  • 適用於rules-v2依目前已審閱模型與工具目錄產生的編輯候選。
  • 結果取決於提交的資料和目錄快照,任一變化都可能改變結果。
  • 它是低風險決策輔助,不證明品質、即時價格、基準領先、安全性、合法性或受監管用途適配。

每個結果必須顯示的稽核資訊

整合後的推薦必須顯示以下七項,讓使用者無需猜測證據邊界。

  1. 推薦理由
  2. 證據
  3. 假設
  4. 最後審閱
  5. 信賴度
  6. 最佳替代項
  7. 何時不應選擇

從真實工作到可複核結論

1

明確評測條件

比較前記錄工作、成功標準、輸入、限制、具體模型版本、設定與日期。

2

使用相同條件

所有候選使用相同工作與評分標準。隱藏模型名稱可減少名稱偏差,但並非雙盲或獨立執行。

3

保留原始資料

保存提示詞、回答、評分、錯誤、延遲與雜湊;缺少資料不以估算補齊。

4

說明結果邊界

公開不確定性、樣本量、排除項目、利益關係,以及結果無法證明什麼。

證據等級

Evidence v1/v2 檢查檔案格式與聲明是否一致;「決策工作台」V3 還會依已保存的輸入重算雜湊、分配、映射、評分與彙總,但不能證明L4 獨立重現。

L1現已支援

格式檢查通過

檔案符合聲明的Schema,且沒有明顯的金鑰欄位。

L2部分支援

記錄完整

工作集、設定、模型資訊與評測日期應完整一致;V1 目前只能檢查其中一部分。

L3V3 已支援

結果可重算

「決策工作台」V3 保存原始回答與評分輸入,可在本機嚴格重算;Evidence v1/v2 不含同等欄位。

L4尚未支援

獨立重現

目標是由獨立執行方或簽署來源在可比條件下重現結果;V1 目前不能核驗。

AI Agent榜單如何比較

每一列代表一個公開Agent設定在指定評測範圍內的成績,不能視為基礎模型本身的分數。

比較系統設定

保留來源公開的Agent、基礎模型、執行框架、工具、環境、預算與日期;未公開的欄位保持未知。

保留原始量尺

只在相同基準、版本、工作規則與可比執行群組內排名,不產生跨基準的萬用總分。

標明資料狀態

區分基準官方榜單記錄、上游核查提交、服務商報告與社群執行。

保留營運資料

來源提供可比資料時顯示成本、延遲、步驟數與人工介入;缺漏值繼續保持未知。

本機核驗能確認什麼

  • 必填欄位與支援的資料型別
  • 評分、執行記錄、日期與雜湊的內部一致性
  • 檔案是否聲明為示範資料
  • 沒有常見API金鑰與敏感欄位

單靠本機核驗無法確認什麼

  • 聲明的服務商或模型是否真的產生輸出
  • 評分是否沒有選擇偏差或薄弱測試設計
  • 一次結果是否適用於所有工作、語言、使用者與未來版本
  • 模型是否適合高風險、安全或法律相關決策

公開原則

不出售排名

贊助可以揭露,但不能改變評分、證據門檻或展示位置。

比較版本,而非品牌

模型系列會持續變化,評測時必須記錄準確的模型ID、設定、地區與日期。

先測真實工作,再做廣泛結論

OpenGPT先依需求縮小候選,再讓使用者以自己的代表性工作驗證。

不確定也是結果

平手、小樣本、失敗執行與無法下結論的證據都應保留。