獨立AI模型決策

AI模型榜單

從公開證據篩選具體模型版本,以同一口徑比較,再用真實任務完成一次可複核的選擇。

客觀任務評分LiveBench · 已顯示 3 筆,共 10 筆
  1. 排名 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. 排名 2Claude Fable 5 Max EffortAnthropic82.97
  3. 排名 3GPT-6 Astra Max EffortOpenAI82.16
資料來自公開評測2 個外部公開來源LiveBench · 資料截止日

本榜單彙整公開評測結果,不另行複測模型。排名僅供比較,選擇前請用真實任務驗證。

資料版本
2026-09公開日期 ·
自動驗證決策範圍
20 個自動驗證決策模型 / 79 個目錄模型資料截止日 · 2026-08-30
目前排名快照 · LiveBench
2026-09-07 · 56 筆來源記錄
最新可比較變化版 · LiveBench
未知
生命週期覆蓋
36 / 79 個生命週期已記錄 · 20 個進入自動驗證範圍資料截止日 · 2026-08-30

選擇榜單維度

先選擇你的使用情境. 每個情境都會開啟最相關的公開排名指標,並保留原始來源和評分尺度。

選擇顯示範圍

顯示發布方的全部記錄及其來源模型ID或來源名稱,包括別名與執行設定。名次依來源原樣保留;並列名次後仍可能出現跳號。

客觀任務評分. LiveBench在 7 個類別、23 個客觀評分任務上的整體成績。

已顯示 10 筆,共 10 筆. 客觀任務評分.

  1. 排名 1
    模型設定
    Published benchmark configuration
    來源模型ID
    claude-fable-5-1-max-effort
    客觀任務評分
    83.41
    原始來源
  2. 排名 2
    模型設定
    Published benchmark configuration
    來源模型ID
    claude-fable-5-max-effort
    客觀任務評分
    82.97
    原始來源
  3. 排名 3
    模型設定
    Published benchmark configuration
    來源模型ID
    gpt-6-astra-max
    客觀任務評分
    82.16
    原始來源
  4. 排名 4
    模型設定
    Published benchmark configuration
    來源模型ID
    muse-spark-1.3-xhigh
    客觀任務評分
    81.59
    原始來源
  5. 排名 5
    模型設定
    Published benchmark configuration
    來源模型ID
    gpt-5.6-sol-max
    客觀任務評分
    81.05
    原始來源
  6. 排名 6
    模型設定
    Published benchmark configuration
    來源模型ID
    gpt-5.5-xhigh
    客觀任務評分
    80.19
    原始來源
  7. 排名 7
    模型設定
    Published benchmark configuration
    來源模型ID
    claude-opus-5-max-effort
    客觀任務評分
    80.08
    原始來源
  8. 排名 8

    Kimi K3

    Moonshot AI
    模型設定
    Published benchmark configuration
    來源模型ID
    kimi-k3
    客觀任務評分
    79.19
    原始來源
  9. 排名 9
    模型設定
    Published benchmark configuration
    來源模型ID
    gemini-3.7-flash-high
    客觀任務評分
    78.83
    原始來源
  10. 排名 10
    模型設定
    Published benchmark configuration
    來源模型ID
    qwen3.8-max
    客觀任務評分
    78.46
    原始來源
獨立來源LiveBench來源收錄 10 筆記錄 · 資料取得日期: 2026年9月9日
LiveBench

監測狀態即時狀態不可用驗證通過後自動發布

來源資料日
OpenGPT取得時間
榜單最近變化

LMArena + LiveBench:驗證後自動發布 · 已暫停來源:僅保留歷史資料

排名方法每個榜單都保留原始指標、版本與評測方法,可透過連結核對來源。

排名依據

完整榜單與官方模型ID

主榜單保留發布方的全部記錄,並顯示來源模型ID或名稱。每筆記錄都能比較:能完整保留設定的精確映射使用官方版本,其餘記錄只在相同來源榜單中比較;缺漏資料不按 0 分處理。
79 個官方模型ID
79
0 個已有公開排名資料
0
79 個等待可比資料
79
LiveBench · 保留 56 筆來源記錄供稽核
56
模型目錄

排名依據

如何閱讀榜單

  • 分數保留各發布方的原始量表,不合併成一個綜合總分。

  • 缺漏資料不等於 0,只表示該發布方在本期快照中沒有報告這項指標。

  • 如果來源註明模型設定,名次只適用於該設定和來源版本,不能直接推廣到所有任務、地區或部署方式。

  • 任何服務商都不能付費購買名次;OpenGPT直接連結原始資料。

排名依據

資料與來源

每個榜單都保留原始指標、版本與評測方法,可透過連結核對來源。
AR

LMArena

LMArena最新風格控制綜合榜單;排名依據使用者對兩個模型回答的比較投票。

榜單發布日期
2026年9月2日
資料取得日期
2026年9月9日
授權條款
CC BY 4.0

原始榜單評分方法

LB

LiveBench

涵蓋 7 個類別的 23 個客觀任務,題目每 6 個月更新。

來源快照
LiveBench-2026-06-25
資料取得日期
2026年9月9日
授權條款
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

原始榜單評分方法

方法版本

定期發布計畫

OpenGPT每 6 小時核查活動模型來源。LMArena與LiveBench只有在帶版本號的驗證策略全部通過後才會自動發布。已暫停來源僅保留為歷史資料,不進入目前榜單。
  1. 01

    每 6 小時核查來源

    LMArena與LiveBench更新僅在通過格式、完整性、日期、完整性雜湊和異常檢測後自動發布;已暫停來源僅保留歷史資料。

  2. 02

    每週變化摘要

    集中說明重要的排名、模型與來源變化,便於一次核對。

  3. 03

    每月歷史快照

    固定帶日期的快照,保留具體設定、來源版本與更正記錄。