- 排名 1Claude Fable 5.1 Max EffortAnthropic83.41
- 排名 2Claude Fable 5 Max EffortAnthropic82.97
- 排名 3GPT-6 Astra Max EffortOpenAI82.16
資料來自公開評測2 個外部公開來源LiveBench · 資料截止日
本榜單彙整公開評測結果,不另行複測模型。排名僅供比較,選擇前請用真實任務驗證。
選擇榜單維度
先選擇你的使用情境. 每個情境都會開啟最相關的公開排名指標,並保留原始來源和評分尺度。
顯示發布方的全部記錄及其來源模型ID或來源名稱,包括別名與執行設定。名次依來源原樣保留;並列名次後仍可能出現跳號。
客觀任務評分. LiveBench在 7 個類別、23 個客觀評分任務上的整體成績。
已顯示 10 筆,共 10 筆. 客觀任務評分.
- 排名 1
Claude Fable 5.1 Max Effort
Anthropic客觀任務評分83.41 - 排名 2
Claude Fable 5 Max Effort
Anthropic客觀任務評分82.97 - 排名 3
GPT-6 Astra Max Effort
OpenAI客觀任務評分82.16 - 排名 4客觀任務評分81.59
- 排名 5
GPT-5.6 Sol Max Effort
OpenAI客觀任務評分81.05 - 排名 6客觀任務評分80.19
- 排名 7
Claude 5 Opus Thinking Max Effort
Anthropic客觀任務評分80.08 - 排名 8
Kimi K3
Moonshot AI客觀任務評分79.19 - 排名 9
Gemini 3.7 Flash High
Google客觀任務評分78.83 - 排名 10
Qwen 3.8 Max
Alibaba客觀任務評分78.46
排名方法每個榜單都保留原始指標、版本與評測方法,可透過連結核對來源。
排名依據
完整榜單與官方模型ID
主榜單保留發布方的全部記錄,並顯示來源模型ID或名稱。每筆記錄都能比較:能完整保留設定的精確映射使用官方版本,其餘記錄只在相同來源榜單中比較;缺漏資料不按 0 分處理。- 79 個官方模型ID
- 79
- 0 個已有公開排名資料
- 0
- 79 個等待可比資料
- 79
- LiveBench · 保留 56 筆來源記錄供稽核
- 56
排名依據
如何閱讀榜單
分數保留各發布方的原始量表,不合併成一個綜合總分。
缺漏資料不等於 0,只表示該發布方在本期快照中沒有報告這項指標。
如果來源註明模型設定,名次只適用於該設定和來源版本,不能直接推廣到所有任務、地區或部署方式。
任何服務商都不能付費購買名次;OpenGPT直接連結原始資料。
排名依據
資料與來源
每個榜單都保留原始指標、版本與評測方法,可透過連結核對來源。方法版本
定期發布計畫
OpenGPT每 6 小時核查活動模型來源。LMArena與LiveBench只有在帶版本號的驗證策略全部通過後才會自動發布。已暫停來源僅保留為歷史資料,不進入目前榜單。- 01
每 6 小時核查來源
LMArena與LiveBench更新僅在通過格式、完整性、日期、完整性雜湊和異常檢測後自動發布;已暫停來源僅保留歷史資料。
- 02
每週變化摘要
集中說明重要的排名、模型與來源變化,便於一次核對。
- 03
每月歷史快照
固定帶日期的快照,保留具體設定、來源版本與更正記錄。