公开榜单来源
LiveBench AI 模型榜单数据
OpenGPT 在原始来源范围内保留22条 LiveBench 公开记录,不重新测试,也不与其他评测合成总分。
- 公开记录
- 22
- 榜单维度
- 客观任务 · 单位得分成本 · 开放权重
- 来源数据日期
- 数据获取日期
数据范围
LiveBench-2026-06-25. Twenty-three objective tasks across seven categories; questions refresh every six months.
OpenGPT 如何处理这些数据
OpenGPT 在同一公开范围内保存发布方的名称、名次、配置、日期与数值;不把缺失值改成零,也不生成跨来源总分。
可比边界
- 名次和数值只能在指定来源版本与榜单范围内比较。
- 只有在模型身份对应依据经过核验后,来源配置才会链接到官方模型 ID。
- 公开榜单用于筛选候选;正式采用前仍需用真实任务测试准确版本。
LiveBench-2026-06-25
展示22条公开记录中的14条代表记录。进入单条记录可核对来源身份与对应依据。
- Claude Fable 5Anthropic · 客观任务#183.0Max effort
- GPT-5.6 SolOpenAI · 客观任务#281.1Max effort
- GPT-5.5OpenAI · 客观任务#380.2xHigh effort
- Claude Opus 5Anthropic · 客观任务#480.1Max effort
- Kimi K3Moonshot AI · 客观任务#579.2Published benchmark configuration
- Qwen 3.8Alibaba · 客观任务#678.5Max effort
- DeepSeek V4 FlashDeepSeek · 单位得分成本#1$0.0161Published benchmark configuration
- Grok Build 0.1xAI · 单位得分成本#2$0.0240Published benchmark configuration
- DeepSeek V4 ProDeepSeek · 单位得分成本#3$0.0498Published benchmark configuration
- DeepSeek V4 Flash 0731DeepSeek · 单位得分成本#4$0.0596Published benchmark configuration
- MiniMax M3MiniMax · 单位得分成本#5$0.0597Published benchmark configuration
- Grok 4.3xAI · 单位得分成本#6$0.0614Published benchmark configuration
- Kimi K3Moonshot AI · 开放权重#179.2Open weights
- DeepSeek V4 Flash 0731DeepSeek · 开放权重#274.2Open weights