起始候选 1
稳定版Qwen 3.7 Max
qwen3.7-max-2026-06-08Alibaba Qwen目前没有映射到这个具体版本的可比公开结果。
中文优先写作、翻译、本地化和混合语言任务。
公开数据可以缩小范围,但不能代替在真实工作中的受控测试。
qwen3.7-max-2026-06-08Alibaba Qwen目前没有映射到这个具体版本的可比公开结果。
kimi-k3Moonshot AI用户偏好 · #10
deepseek-v4-proDeepSeek用户偏好 · #46
不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。
公开综合榜单不是中文专项评测,语言质量必须直接测试。
系统会预选本任务模板和前两个已选候选;收集回答前可以编辑全部任务。