01 · 工作榜單

日常工作

寫作、分析、規劃與綜合辦公工作。

官方版本
3
公開資料
3
資料截止日:
為什麼選擇這些候選
優先查看具有目前公開偏好資料的通用模型,再用你的重複性工作進行驗證。
仍需驗證的部分
綜合偏好排名不能預測專業工作中的準確性。
公開資料
使用者偏好
資料截止日
起始候選

三個值得優先測試的官方版本

公開資料可以縮小範圍,但不能取代真實工作中的受控測試。

3 / 3
起始候選 1

Claude Fable 5

穩定版
claude-fable-5

Anthropic使用者偏好 · #1

模型官網
起始候選 2

GPT-5.6 Sol

穩定版
gpt-5.6-sol

OpenAI使用者偏好 · #11

模型官網
起始候選 3

Gemini 3.5 Flash

穩定版
gemini-3.5-flash

Google使用者偏好 · #17

模型官網
公開資料不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。

Claude Fable 5

資料來源
LMArena
來源排名
#1
來源原始值
1507
對應核實日期

GPT-5.6 Sol

資料來源
LMArena
來源排名
#11
來源原始值
1485
對應核實日期

Gemini 3.5 Flash

資料來源
LMArena
來源排名
#17
來源原始值
1476
對應核實日期
這是實測起點,不是萬用冠軍選擇兩個或三個候選,查看並列的公開資料。

不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。

綜合偏好排名不能預測專業工作中的準確性。

系統會預選這項工作範本與前兩個已選候選;收集回答前可編輯全部工作。