- 排名 1Claude Fable 5.1 Max EffortAnthropic83.41
- 排名 2Claude Fable 5 Max EffortAnthropic82.97
- 排名 3GPT-6 Astra Max EffortOpenAI82.16
数据来自公开评测2 个外部公开来源LiveBench · 数据截止日
本榜单汇集公开评测结果,不另行复测模型。排名仅供比较,选择前请用真实任务验证。
选择榜单维度
先选择你的使用场景. 每个场景都会打开最相关的公开排名指标,并保留原始来源和评分尺度。
显示发布方的全部记录及其来源模型ID或来源名称,包括别名和运行配置。名次按来源原样保留;并列名次后仍可能出现跳号。
客观任务评分. LiveBench在 7 个类别、23 个客观评分任务上的总体成绩。
已显示 10 条,共 10 条. 客观任务评分.
- 排名 1
Claude Fable 5.1 Max Effort
Anthropic客观任务评分83.41 - 排名 2
Claude Fable 5 Max Effort
Anthropic客观任务评分82.97 - 排名 3
GPT-6 Astra Max Effort
OpenAI客观任务评分82.16 - 排名 4客观任务评分81.59
- 排名 5
GPT-5.6 Sol Max Effort
OpenAI客观任务评分81.05 - 排名 6客观任务评分80.19
- 排名 7
Claude 5 Opus Thinking Max Effort
Anthropic客观任务评分80.08 - 排名 8
Kimi K3
Moonshot AI客观任务评分79.19 - 排名 9
Gemini 3.7 Flash High
Google客观任务评分78.83 - 排名 10
Qwen 3.8 Max
Alibaba客观任务评分78.46
排名方法每个榜单都保留原始指标、版本和评测方法,可通过链接核对来源。
排名依据
完整榜单与官方模型ID
主榜单保留发布方的全部记录,并显示来源模型ID或名称。每条记录都能比较:能够完整保留配置的精确映射使用官方版本,其余记录只在同一来源榜单中比较;缺失数据不按 0 分处理。- 79 个官方模型ID
- 79
- 0 个已有公开排名
- 0
- 79 个等待可比数据
- 79
- LiveBench · 保留 56 条来源记录供审计
- 56
排名依据
如何阅读榜单
分数保留各发布方的原始量表,不合并成一个综合总分。
缺失数据不等于 0,只表示该发布方在本期快照中没有报告这项指标。
如果来源注明模型设置,名次只适用于该设置和来源版本,不能直接推广到所有任务、地区或部署方式。
任何服务商都不能付费购买名次;OpenGPT直接链接原始数据。
排名依据
数据与来源
每个榜单都保留原始指标、版本和评测方法,可通过链接核对来源。方法版本
定期发布计划
OpenGPT每 6 小时核查活动模型来源。LMArena与LiveBench只有在带版本号的验证策略全部通过后才会自动发布。已暂停来源仅保留为历史资料,不进入当前榜单。- 01
每 6 小时核查来源
LMArena与LiveBench更新仅在通过格式、完整性、日期、完整性哈希和异常检测后自动发布;已暂停来源仅保留历史资料。
- 02
每周变化摘要
集中说明重要的排名、模型和来源变化,便于一次核对。
- 03
每月历史快照
固定带日期的快照,保留具体配置、来源版本和更正记录。