沒有模型符合全部要求
查看各候選被排除的原因,只放寬真正可調整的條件。
檢查需求找到合適的操作流程,依步驟完成,並了解結果能說明什麼、不能說明什麼。
每個流程回答不同問題。選擇最接近的目標,再依指南繼續。
了解榜單排列什麼、資料來自哪裡,以及哪些記錄帶有官方模型ID。
查看不同榜單的公開資料與原始記錄,為真實工作評測建立候選名單。
先明確要解決的問題。使用者偏好、綜合能力、客觀工作、成本與開放權重榜單使用不同來源與評分標準。
名次只代表模型在目前來源與評測範圍中的相對位置。並列會使序號跳號,不同榜單維度的分數也不能直接比較。
OpenGPT彙整第三方公開資料,並未重新執行這些評測。榜單不能證明某個模型適合所有使用者或工作。
現在每筆記錄都有模型詳情與比較操作。只有服務商資料能證明精確對應關係時才顯示官方模型ID;其餘記錄依來源資料比較,保留來源名稱、執行設定與榜單資料,不會虛構新的官方ID。
依工作、完整設定、證據品質與可比較結果選擇Agent。
瀏覽七類工作下的96筆Agent評測設定,以及另外展示的109筆BFCL工具呼叫模型結果;不同證據不會被強行合成一個分數。
每項成績都對應一個完整設定:基礎模型、執行框架、工具、權限、預算、環境、評測版本與日期。OpenGPT保留來源公開的欄位;缺漏資料標為「未報告」,不會視為 0。
名次只表示一個完整系統設定在目前評測範圍內的相對位置。應搭配證據等級、資料新鮮度、執行次數,以及已報告的成本與可靠性閱讀。
OpenGPT不製造萬用Agent總分。除非明確標示「OpenGPT已重現」,其餘結果是整理上游公開證據;任何單一評測都不能證明適合所有正式流程。
執行框架、模型版本、工具、權限、預算或評測設定不同,就屬於不同的Agent設定,必須分別記錄。
把公開身分或證據記錄交給管理員審核,不直接改變榜單。
當官方模型ID、Agent產品尚未收錄,或公開來源需要人工核驗時使用。
先登入已驗證帳戶,並準備公開HTTPS來源。請勿提交憑證、私人檔案或個人資訊。
提交成功後會取得編號並進入審核佇列。公開候選記錄只是可查看的公開證據,不等於目錄收錄或榜單排名。
提交者不能設定排名、證據等級、可比狀態或公開狀態。系統透過重複檢查與頻率限制降低濫用;審核通過也不會自動修改榜單。
審核通過只表示記錄通過編輯核驗。目錄身分與可比榜單證據仍需分別驗證,之後才可能納入。
查看可比快照之間的真實排名變化,並比較目錄中的模型ID。
了解上一期之後哪些記錄有變化、哪些首次上榜、具體版本有何差異,以及資料何時取得。
歷史變化目前使用LMArena使用者偏好榜。其他來源在取得可比的上一期快照前只顯示目前資料。
只有來源、範圍、單位與方法一致時才計算變化;每月快照可下載核對。
只有服務商資料中註明的日期才作為產品發布日期。版本比較不會依名稱推測速度、價格、上下文長度或品質。
這些來源還沒有可比的上一期快照。系統會明確顯示歷史不足,而不會製造變化。
從真實工作情境開始,查看三個值得優先測試的官方模型版本。
把較寬泛的公開資料轉化為適用於程式設計、研究、文件、客服、多語言、多模態、成本、私有部署或高速工作的簡潔候選名單。
選擇最接近真實工作的情境,並明確你的提示詞、資料、工具、地區、預算與隱私要求。頁面引用的公開資料範圍可能比目前工作更廣。
你會取得三個官方起始候選、可用的公開依據,以及繼續進行資料比較與真實工作測試的入口。
工作榜單只是起始候選,不是萬用排名,也不能證明哪個模型最好。缺漏資料不會按 0 計算,不同公開來源也不會合併成一個分數。
某個官方版本可能因產品定位或部署方式適合該工作,但所選公開來源尚未對應到這個具體版本。系統會明確保留缺漏狀態,最終仍需以你的工作驗證。
設定目前使用的模型、常用工作與優先事項,只查看真正值得進行公平比較的變化。
判斷公開的可比資料是否足以支持你測試目前模型的替代方案。
選擇具體官方版本、至少一項常用工作,以及最多兩項優先事項。設定只會儲存在目前裝置。
升級雷達會產生只儲存在本裝置的檢查結果,包括目前模型、符合工作的替代方案、資料日期、不確定性範圍與比較入口。
升級檢查不是更換模型的指示。缺少可比資料的條件仍需直接測試,本機設定不會同步或備份。
不是。這表示值得用相同工作進行測試。只有替代模型在你的真實工作與限制下表現更好時,才應考慮更換。
把 4 個實際要求轉為可解釋的候選名單。
當你知道要完成什麼工作,卻不知道先研究哪個模型系列時,使用模型選擇助手。
先整理主要工作、允許的部署位置、最重要的營運偏好,以及語言需求。
定性符合標籤與符合項目數量僅適用於模型系列,不代表具體版本表現或基準分數。請確認所列目前版本的部署可用性,並以相同工作比較。
選擇助手不會呼叫模型、核對即時價格,也不會提供適合所有人的冠軍。同一模型系列的不同版本可能差異很大。
排序依據是你選擇的限制條件,不是知名度。可修改一項條件觀察變化,再用真實工作比較具體版本。
查找服務商資料中的模型ID,開啟獨立詳細頁,並查看是否已有可比的公開排名資料。
需要準確的官方模型ID、服務商入口、適用與不適用工作、資料來源和排名資料狀態時,使用模型目錄。
準備模型名稱、服務商、部署要求或工作。服務商資料中有模型ID,不代表一定有可比的公開評測資料。
「已納入排名」表示可比公開資料已對應至該模型ID;「暫未排名」表示本期沒有適用的可比記錄,不等於零分。
服務商資料用於確認目錄身分,不代表該版本目前在所有國家或服務方案都可用。榜單涵蓋與服務條款可能在核實日期後變更。
不是。它只代表本期沒有適用於該模型ID的可比公開資料。若仍符合需求,請以真實工作直接驗證。
可以比較 2–4 個具體官方版本,也可以比較同一公開榜單中的來源記錄。
官方版本比較用於整理服務商資料中的模型ID;若轉換成官方版本會遺失來源設定,則使用來源記錄比較保留發布名稱與設定。
官方版本請選擇 2–4 個目錄ID;來源記錄請選擇相同來源、榜單維度與快照中的 2–4 筆記錄。
資料比較會形成一份有來源依據的候選清單,並清楚顯示資訊缺口;它不會產生新的基準分數,也不會宣告適合所有人的冠軍。
這項功能不會呼叫模型。不同來源或評測範圍的分數不能直接互換,模型資料也可能在核實日期後變更。
公開資料比較整理 2–4 個模型已發布的資訊;真實工作評測只接收兩個具體版本,需要你在兩個服務中執行相同提示詞,再隱藏模型名稱評閱貼上的回答。
把榜單中的候選收藏到目前瀏覽器,建立一份簡單的工作清單。
以「已存模型」快速返回候選、開啟可信的官方入口,並把支援的模型ID加入比較。
請使用同一瀏覽器與裝置。這份清單儲存在本機,不需要OpenGPT帳號,也不會同步至雲端。
「已存模型」旁的數字代表已收藏數量。來源身分與官方模型身分始終分開儲存。
這不是帳號、書籤同步或雲端備份。其他瀏覽器或裝置無法看到;無痕模式、瀏覽器限制儲存或清除網站資料都可能使清單遺失。
請確認仍使用同一裝置與瀏覽器設定檔。若網站資料已清除或瀏覽器阻擋本機儲存,OpenGPT無法還原這份本機清單。
使用真實工作,並把決策專案儲存在本機。
以範本或可編輯的自訂工作比較兩個具體版本。
請選擇兩個不同、支援相同工作流程的目錄模型ID。請自行開啟兩個服務商,核對版本與設定並移除敏感資料;提交內容受相應服務商政策約束。
綜合判斷決定逐題結果。差異較小或完成工作少於 3 個時,結果保持證據不足。
隱藏名稱僅減少可見標籤偏差;不是雙盲或獨立執行,也不核驗回答來源或建立通用排名。
沒有服務商目錄模型ID的來源記錄不能加入目錄資料比較。同一模型也可能已選取,或目前清單已達 4 個模型上限。
重複使用同一組真實提示詞,日後評測模型時無需重新建立工作集。
讓後續比較保持更一致的測試條件,並在模型更新或公開資料變化後重新評估具體版本。
完成工作標題與提示詞,填寫容易識別的工作集名稱,並使用同一裝置與瀏覽器。工作集可能包含真實工作內容,儲存前請移除敏感資訊。
工作集名稱、範本、語言、工作標題與提示詞會儲存在本機,供日後重複使用。重新評估會保留測試輸入,並開始一輪乾淨的新測試。
工作集僅儲存在本機,不會同步或備份。工作集不會儲存回答、模型選擇、評審、報告或API金鑰;清除網站資料後,全部工作集可能消失。
系統會保留同一組工作與兩個具體模型版本,清除舊回答、評分、判斷、揭曉狀態與報告,使新一輪測試不受舊結果影響。
檢查支援JSON的結構、內部一致性、金鑰風險模式與本機指紋。
可以核驗OpenGPT Evidence v1/v2 證據包,也能核驗從「決策工作台」下載的V3 報告。全部檢查都在目前瀏覽器本機完成。
取得原始JSON檔案。比較報告應從「決策工作台」下載;若需要完整結果而非草稿,請先完成全部測試。
對Evidence v1/v2,「通過」代表檔案符合支援的結構與一致性規則,「展示」代表它是範例。對比較報告,「通過」代表完整報告內部一致;「草稿」代表結構有效,但比較尚未完成。「失敗」代表至少一個必查項目需要處理。
檢查通過不能證明所填模型確實產生了貼上的回答、服務商聲明為真,也不能證明結果適用於已記錄測試以外的工作。不同檔案的結果不能自動比較。
不能。它只確認支援報告的結構有效且內部一致。你仍需判斷模型身分、測試品質、回答內容及結果是否適用於真實決策。
了解什麼樣的模型選擇過程可以檢查與重現。
在設計、公開或依賴模型評測前使用,避免把模型知名度誤當成證據品質。
準備具體決策問題、準確的模型版本、具代表性的工作,以及保存原始回答的計畫。
Evidence v1/v2 主要檢查格式與聲明;「決策工作台」V3 支援本機重算(L3),但仍不支援L4 獨立重現。
嚴謹流程可減少偏差,但不能保證樣本代表所有使用者、語言、未來模型版本或正式環境。
依決策後果選擇。個人試用可能只需L1;公開或高風險主張應尋求更強的獨立證據。
遇到不熟悉的標籤時,可在這裡快速查看。
查看各候選被排除的原因,只放寬真正可調整的條件。
檢查需求公開來源可能有並列名次或多個執行設定。OpenGPT保留來源位置,不會為了連續顯示而重新編號。
榜單說明來源沒有發布可比較資料。OpenGPT會保留「未報告」,不會把缺漏資料視為 0;請只比較相同評測範圍內已有的數值。
查看Agent證據這不是未完成狀態,而是已歸類的來源記錄。可開啟原始來源查看;需要官方模型ID時,請使用模型目錄。
來源身分說明請使用同一裝置與瀏覽器設定檔。無痕模式、瀏覽器阻擋儲存或清除網站資料,都可能移除本機清單。
我的模型資料比較使用目錄中的模型ID。同一版本可能已選取,或清單已達 4 個版本上限。請選擇其他目錄版本,或先移除一個候選。
開啟模型目錄返回所有標記的測試,補充兩個完整回答並選擇判斷結果。
繼續比較返回比較頁面,查看較新草稿提示,再明確選擇保留或重設。
檢查本機草稿依失敗項目修正來源記錄。不要加入金鑰,也不要為了通過而改寫結果。
核驗工具歡迎回報失效連結、錯誤的模型資訊或尚未解決的問題。