08 · 工作榜單

高性價比生產

不只看單價,降低每次成功工作的總成本。

官方版本
3
公開資料
3
資料截止日:
為什麼選擇這些候選
用公開的單位成功成本形成候選,再測量重試次數、延遲與維運負擔。
仍需驗證的部分
公開價格與工作負載會變化;不同服務商的 Token 統計及你的成功標準也不同。
公開資料
單位成功工作成本
資料截止日
起始候選

三個值得優先測試的官方版本

公開資料可以縮小範圍,但不能取代真實工作中的受控測試。

3 / 3
起始候選 1

Grok 4.5

穩定版
grok-4.5

xAI單位成功工作成本 · #1

模型官網
起始候選 2

GPT-5.6 Luna

穩定版
gpt-5.6-luna

OpenAI單位成功工作成本 · #5

模型官網
起始候選 3

Gemini 3.5 Flash

穩定版
gemini-3.5-flash

Google單位成功工作成本 · #9

模型官網
公開資料不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。

Grok 4.5

資料來源
LiveBench
來源排名
#1
來源原始值
$0.128
對應核實日期

GPT-5.6 Luna

資料來源
LiveBench
來源排名
#5
來源原始值
$0.202
對應核實日期

Gemini 3.5 Flash

資料來源
LiveBench
來源排名
#9
來源原始值
$0.249
對應核實日期
這是實測起點,不是萬用冠軍選擇兩個或三個候選,查看並列的公開資料。

不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。

公開價格與工作負載會變化;不同服務商的 Token 統計及你的成功標準也不同。

系統會預選這項工作範本與前兩個已選候選;收集回答前可編輯全部工作。