起始候选 1
全面可用Claude Fable 5
claude-fable-5Anthropic用户偏好 · 1
写作、分析、规划和综合办公任务。
公开数据可以缩小范围,但不能代替在真实工作中的受控测试。 选择两个或三个候选,查看并列的公开数据。
claude-fable-5Anthropic用户偏好 · 1
gpt-5.6-solOpenAI用户偏好 · 18
gemini-3.5-flashGoogle用户偏好 · 19
不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。
综合偏好排名不能预测专业工作中的准确性。
系统会预选本任务模板和前两个已选候选;收集回答前可以编辑全部任务。