起始候选 1
稳定版Claude Fable 5
claude-fable-5Anthropic综合能力 · #1
多步骤分析、证据综合和有依据的结论。
公开数据可以缩小范围,但不能代替在真实工作中的受控测试。
claude-fable-5Anthropic综合能力 · #1
gpt-5.6-solOpenAI综合能力 · #2
kimi-k3Moonshot AI综合能力 · #4
不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。
榜单覆盖不能证明来源质量、联网检索质量或你所在领域的事实可靠性。
系统会预选本任务模板和前两个已选候选;收集回答前可以编辑全部任务。