起始候選 1
穩定版Claude Fable 5
claude-fable-5Anthropic使用者偏好 · #1
寫作、分析、規劃與綜合辦公工作。
公開資料可以縮小範圍,但不能取代真實工作中的受控測試。
claude-fable-5Anthropic使用者偏好 · #1
gpt-5.6-solOpenAI使用者偏好 · #11
gemini-3.5-flashGoogle使用者偏好 · #17
不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。
綜合偏好排名不能預測專業工作中的準確性。
系統會預選這項工作範本與前兩個已選候選;收集回答前可編輯全部工作。