公開榜單來源

LiveBench AI模型榜單資料

OpenGPT在原始來源範圍內保留30筆LiveBench公開記錄,不重新測試,也不與其他評測合成總分。

公開記錄
30
榜單維度
客觀工作 · 單位得分成本 · 開放權重
來源資料日期
資料取得日期

資料範圍

LiveBench-2026-06-25. 51 個已發佈模型配置,覆蓋 23 項客觀任務和 7 個類別;問題每 6 個月更新一次。

OpenGPT如何處理這些資料

OpenGPT在同一公開範圍內保存發布方的名稱、名次、設定、日期與數值;不把缺失值改成零,也不產生跨來源總分。

可比範圍

  • 名次和數值只能在指定來源版本與榜單範圍內比較。
  • 只有在模型身分對應依據經過核驗後,來源設定才會連結到官方模型ID。
  • 公開榜單用於篩選候選;正式採用前仍需用真實工作測試準確版本。

LiveBench-2026-06-25

展示30筆公開記錄中的18筆代表記錄。進入單筆記錄可核對來源身分與對應依據。

  1. Claude Fable 5.1 Max EffortAnthropic · 客觀工作#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · 客觀工作#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · 客觀工作#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · 客觀工作#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · 客觀工作#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · 客觀工作#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · 單位得分成本#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · 單位得分成本#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · 單位得分成本#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · 單位得分成本#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · 單位得分成本#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · 單位得分成本#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · 開放權重#179.19開放權重
  14. Qwen 3.8 MaxAlibaba · 開放權重#278.46開放權重
  15. DeepSeek V4 Pro 0813DeepSeek · 開放權重#377.44開放權重
  16. DeepSeek V4 Flash Vision ExpDeepSeek · 開放權重#476.76開放權重
  17. Qwen 3.8 Flash NextAlibaba · 開放權重#576.19開放權重
  18. GLM-5.3Z.AI · 開放權重#676.14開放權重