05 · 任务榜单

客户支持

清晰、安全并符合政策的常见请求回复。

官方版本
3
公开数据
1
数据截止日:
为什么选择这些候选
从均衡型和企业型模型开始,再用你的案例评估政策遵循、同理心和升级处理。
仍需验证的部分
公开偏好数据不会测试你的政策、系统集成、语言组合或监管义务。
公开数据
用户偏好
数据截止日
起始候选

三个值得优先测试的官方版本

公开数据可以缩小范围,但不能代替在真实工作中的受控测试。

3 / 3
起始候选 1

Claude Sonnet 5

稳定版
claude-sonnet-5

Anthropic用户偏好 · #38

模型官网
起始候选 2

GPT-5.6 Terra

稳定版
gpt-5.6-terra

OpenAI目前没有映射到这个具体版本的可比公开结果。

模型官网
起始候选 3

Command A+

稳定版
command-a-plus-05-2026

Cohere目前没有映射到这个具体版本的可比公开结果。

模型官网
公开数据不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。

Claude Sonnet 5

数据来源
LMArena
来源排名
#38
来源原始值
1461
映射核实日期

GPT-5.6 Terra

目前没有映射到这个具体版本的可比公开结果。

Command A+

目前没有映射到这个具体版本的可比公开结果。

这是实测起点,不是万能冠军选择两个或三个候选,查看并列的公开数据。

不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。

公开偏好数据不会测试你的政策、系统集成、语言组合或监管义务。

系统会预选本任务模板和前两个已选候选;收集回答前可以编辑全部任务。