04 · 工作榜單

文件與有依據的問答

長文件、摘要、引用以及僅依據所給正文回答。

官方版本
3
公開資料
1
資料截止日:
為什麼選擇這些候選
比較面向長上下文或企業檢索的模型,再用真實文件檢查引用與拒答表現。
仍需驗證的部分
上下文長度並不能證明檢索品質或對長文件的忠實程度。
公開資料
綜合能力
資料截止日
起始候選

三個值得優先測試的官方版本

公開資料可以縮小範圍,但不能取代真實工作中的受控測試。

3 / 3
起始候選 1

Gemini 3.1 Pro

預覽版
gemini-3.1-pro-preview

Google目前沒有對應到這個具體版本的可比較公開結果。

模型官網
起始候選 2

Claude Fable 5

穩定版
claude-fable-5

Anthropic綜合能力 · #1

模型官網
起始候選 3

Command A+

穩定版
command-a-plus-05-2026

Cohere目前沒有對應到這個具體版本的可比較公開結果。

模型官網
公開資料不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。

Gemini 3.1 Pro

目前沒有對應到這個具體版本的可比較公開結果。

Command A+

目前沒有對應到這個具體版本的可比較公開結果。

這是實測起點,不是萬用冠軍選擇兩個或三個候選,查看並列的公開資料。

不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。

上下文長度並不能證明檢索品質或對長文件的忠實程度。

系統會預選這項工作範本與前兩個已選候選;收集回答前可編輯全部工作。