03 · 任务榜单

深度研究

多步骤分析、证据综合和有依据的结论。

官方版本
3
公开数据
3
数据截止日:
为什么选择这些候选
优先选择具有当前智能指数和客观任务数据的模型,再检查引用规范与不确定性处理。
仍需验证的部分
榜单覆盖不能证明来源质量、联网检索质量或你所在领域的事实可靠性。
公开数据
综合能力
数据截止日
起始候选

三个值得优先测试的官方版本

公开数据可以缩小范围,但不能代替在真实工作中的受控测试。

3 / 3
起始候选 1

Claude Fable 5

稳定版
claude-fable-5

Anthropic综合能力 · #1

模型官网
起始候选 2

GPT-5.6 Sol

稳定版
gpt-5.6-sol

OpenAI综合能力 · #2

模型官网
起始候选 3

Kimi K3

稳定版
kimi-k3

Moonshot AI综合能力 · #4

模型官网
公开数据不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。
这是实测起点,不是万能冠军选择两个或三个候选,查看并列的公开数据。

不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。

榜单覆盖不能证明来源质量、联网检索质量或你所在领域的事实可靠性。

系统会预选本任务模板和前两个已选候选;收集回答前可以编辑全部任务。