独立AI模型决策

AI模型榜单

从公开证据筛选具体模型版本,用同一口径比较,再用真实任务完成一次可复核的选择。

客观任务评分LiveBench · 已显示 3 条,共 10 条
  1. 排名 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. 排名 2Claude Fable 5 Max EffortAnthropic82.97
  3. 排名 3GPT-6 Astra Max EffortOpenAI82.16
数据来自公开评测2 个外部公开来源LiveBench · 数据截止日

本榜单汇集公开评测结果,不另行复测模型。排名仅供比较,选择前请用真实任务验证。

数据版本
2026-09发布日期 ·
自动验证决策范围
20 个自动验证决策模型 / 79 个目录模型数据截止日 · 2026-08-30
当前排名快照 · LiveBench
2026-09-07 · 56 条来源记录
最新可比变化版 · LiveBench
未知
生命周期覆盖
36 / 79 个生命周期已记录 · 20 个进入自动验证范围数据截止日 · 2026-08-30

选择榜单维度

先选择你的使用场景. 每个场景都会打开最相关的公开排名指标,并保留原始来源和评分尺度。

选择显示范围

显示发布方的全部记录及其来源模型ID或来源名称,包括别名和运行配置。名次按来源原样保留;并列名次后仍可能出现跳号。

客观任务评分. LiveBench在 7 个类别、23 个客观评分任务上的总体成绩。

已显示 10 条,共 10 条. 客观任务评分.

  1. 排名 1
    模型设置
    Published benchmark configuration
    来源模型ID
    claude-fable-5-1-max-effort
    客观任务评分
    83.41
    原始来源
  2. 排名 2
    模型设置
    Published benchmark configuration
    来源模型ID
    claude-fable-5-max-effort
    客观任务评分
    82.97
    原始来源
  3. 排名 3
    模型设置
    Published benchmark configuration
    来源模型ID
    gpt-6-astra-max
    客观任务评分
    82.16
    原始来源
  4. 排名 4
    模型设置
    Published benchmark configuration
    来源模型ID
    muse-spark-1.3-xhigh
    客观任务评分
    81.59
    原始来源
  5. 排名 5
    模型设置
    Published benchmark configuration
    来源模型ID
    gpt-5.6-sol-max
    客观任务评分
    81.05
    原始来源
  6. 排名 6
    模型设置
    Published benchmark configuration
    来源模型ID
    gpt-5.5-xhigh
    客观任务评分
    80.19
    原始来源
  7. 排名 7
    模型设置
    Published benchmark configuration
    来源模型ID
    claude-opus-5-max-effort
    客观任务评分
    80.08
    原始来源
  8. 排名 8

    Kimi K3

    Moonshot AI
    模型设置
    Published benchmark configuration
    来源模型ID
    kimi-k3
    客观任务评分
    79.19
    原始来源
  9. 排名 9
    模型设置
    Published benchmark configuration
    来源模型ID
    gemini-3.7-flash-high
    客观任务评分
    78.83
    原始来源
  10. 排名 10
    模型设置
    Published benchmark configuration
    来源模型ID
    qwen3.8-max
    客观任务评分
    78.46
    原始来源
独立来源LiveBench来源收录 10 条记录 · 数据获取日期: 2026年9月9日
LiveBench

监测状态实时状态不可用验证通过后自动发布

来源数据日
OpenGPT获取时间
榜单最近变化

LMArena + LiveBench:验证后自动发布 · 已暂停来源:仅保留历史资料

排名方法每个榜单都保留原始指标、版本和评测方法,可通过链接核对来源。

排名依据

完整榜单与官方模型ID

主榜单保留发布方的全部记录,并显示来源模型ID或名称。每条记录都能比较:能够完整保留配置的精确映射使用官方版本,其余记录只在同一来源榜单中比较;缺失数据不按 0 分处理。
79 个官方模型ID
79
0 个已有公开排名
0
79 个等待可比数据
79
LiveBench · 保留 56 条来源记录供审计
56
模型目录

排名依据

如何阅读榜单

  • 分数保留各发布方的原始量表,不合并成一个综合总分。

  • 缺失数据不等于 0,只表示该发布方在本期快照中没有报告这项指标。

  • 如果来源注明模型设置,名次只适用于该设置和来源版本,不能直接推广到所有任务、地区或部署方式。

  • 任何服务商都不能付费购买名次;OpenGPT直接链接原始数据。

排名依据

数据与来源

每个榜单都保留原始指标、版本和评测方法,可通过链接核对来源。
AR

LMArena

LMArena最新风格控制综合榜单;排名依据用户对两个模型回答的比较投票。

榜单发布日期
2026年9月2日
数据获取日期
2026年9月9日
许可协议
CC BY 4.0

原始榜单评分方法

LB

LiveBench

覆盖 7 个类别的 23 个客观任务,题目每 6 个月更新。

来源快照
LiveBench-2026-06-25
数据获取日期
2026年9月9日
许可协议
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

原始榜单评分方法

方法版本

定期发布计划

OpenGPT每 6 小时核查活动模型来源。LMArena与LiveBench只有在带版本号的验证策略全部通过后才会自动发布。已暂停来源仅保留为历史资料,不进入当前榜单。
  1. 01

    每 6 小时核查来源

    LMArena与LiveBench更新仅在通过格式、完整性、日期、完整性哈希和异常检测后自动发布;已暂停来源仅保留历史资料。

  2. 02

    每周变化摘要

    集中说明重要的排名、模型和来源变化,便于一次核对。

  3. 03

    每月历史快照

    固定带日期的快照,保留具体配置、来源版本和更正记录。