公开榜单来源

LiveBench AI模型榜单数据

OpenGPT在原始来源范围内保留30条LiveBench公开记录,不重新测试,也不与其他评测合成总分。

公开记录
30
榜单维度
客观任务 · 单位得分成本 · 开放权重
来源数据日期
数据获取日期

数据范围

LiveBench-2026-06-25. 51 个已发布模型配置,覆盖 23 项客观任务和 7 个类别;问题每 6 个月更新一次。

OpenGPT如何处理这些数据

OpenGPT在同一公开范围内保存发布方的名称、名次、配置、日期与数值;不把缺失值改成零,也不生成跨来源总分。

可比边界

  • 名次和数值只能在指定来源版本与榜单范围内比较。
  • 只有在模型身份对应依据经过核验后,来源配置才会链接到官方模型ID。
  • 公开榜单用于筛选候选;正式采用前仍需用真实任务测试准确版本。

LiveBench-2026-06-25

展示30条公开记录中的18条代表记录。进入单条记录可核对来源身份与对应依据。

  1. Claude Fable 5.1 Max EffortAnthropic · 客观任务#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · 客观任务#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · 客观任务#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · 客观任务#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · 客观任务#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · 客观任务#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · 单位得分成本#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · 单位得分成本#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · 单位得分成本#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · 单位得分成本#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · 单位得分成本#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · 单位得分成本#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · 开放权重#179.19开放权重
  14. Qwen 3.8 MaxAlibaba · 开放权重#278.46开放权重
  15. DeepSeek V4 Pro 0813DeepSeek · 开放权重#377.44开放权重
  16. DeepSeek V4 Flash Vision ExpDeepSeek · 开放权重#476.76开放权重
  17. Qwen 3.8 Flash NextAlibaba · 开放权重#576.19开放权重
  18. GLM-5.3Z.AI · 开放权重#676.14开放权重