起始候選 1
穩定版Claude Fable 5
claude-fable-5Anthropic綜合能力 · #1
多步驟分析、證據整合與有依據的結論。
公開資料可以縮小範圍,但不能取代真實工作中的受控測試。
claude-fable-5Anthropic綜合能力 · #1
gpt-5.6-solOpenAI綜合能力 · #2
kimi-k3Moonshot AI綜合能力 · #4
不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。
榜單涵蓋不能證明來源品質、連網搜尋品質或你所在領域的事實可靠性。
系統會預選這項工作範本與前兩個已選候選;收集回答前可編輯全部工作。