08 · 任务榜单

高性价比生产

不只看单价,降低每次成功任务的总成本。

官方版本
3
公开数据
0
数据截止日
为什么选择这些候选
用公开的单位成功成本形成候选,再测量重试次数、延迟和运维负担。
仍需验证的部分
公开价格和工作负载会变化;不同服务商的Token统计及你的成功标准也不同。
起始候选

三个值得优先测试的官方版本

公开数据可以缩小范围,但不能代替在真实工作中的受控测试。 选择两个或三个候选,查看并列的公开数据。

0 / 3
起始候选 1

Grok 4.5

全面可用
grok-4.5

xAI目前没有映射到这个具体版本的可比公开结果。

模型官网
起始候选 2

GPT-5.6 Luna

全面可用
gpt-5.6-luna

OpenAI目前没有映射到这个具体版本的可比公开结果。

模型官网
起始候选 3

Gemini 3.5 Flash

全面可用
gemini-3.5-flash

Google目前没有映射到这个具体版本的可比公开结果。

模型官网
全部任务榜单
公开数据不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。

Grok 4.5

目前没有映射到这个具体版本的可比公开结果。

GPT-5.6 Luna

目前没有映射到这个具体版本的可比公开结果。

Gemini 3.5 Flash

目前没有映射到这个具体版本的可比公开结果。

这是实测起点,不是万能冠军选择两个或三个候选,查看并列的公开数据。

不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。

公开价格和工作负载会变化;不同服务商的Token统计及你的成功标准也不同。

系统会预选本任务模板和前两个已选候选;收集回答前可以编辑全部任务。