04 · 任务榜单
文档与有依据的问答
长文件、摘要、引用以及仅依据所给正文回答。
- 为什么选择这些候选
- Assumption · Historical. 比较面向长上下文或企业检索的模型,再用真实文档检查引用与拒答表现。
- 仍需验证的部分
- 上下文长度并不能证明检索质量或对长文档的忠实程度。
起始候选
0 / 3三个值得优先测试的官方版本
公开数据可以缩小范围,但不能代替在真实工作中的受控测试。 选择两个或三个候选,查看并列的公开数据。
Unknown · Not automatically certified
目前没有映射到这个具体版本的可比公开结果。
公开数据不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。+
这是实测起点,不是万能冠军选择两个或三个候选,查看并列的公开数据。+
不同公开数据使用不同量尺。缺失数据不会按 0 计算,不同来源也不会被合并成一个分数。
上下文长度并不能证明检索质量或对长文档的忠实程度。
系统会预选本任务模板和前两个已选候选;收集回答前可以编辑全部任务。