OPENGPT 证据协议 V1

模型选择是否可信,取决于证据是否可信。

OpenGPT 把需求匹配、亲自比较和公开证据分开。每个结论都应说明测了什么、在什么条件下测,以及哪些部分仍未验证。

从真实任务到可复核结论

1

先冻结问题

比较前记录任务、成功标准、输入、约束、模型版本、日期与设置。

2

在相同条件下运行

所有候选使用同一任务和评分标准。需要盲测偏好时,请使用外部随机化工具;当前私有比较不会隐藏模型名称。

3

保留原始证据

保存提示词、输出、评分、错误、延迟与哈希;缺失的证据不能用估算补齐。

4

公开结论边界

说明不确定性、样本量、排除项、利益关系,以及结果不能证明什么。

证据等级目标标准

当前本地核验器完整支持 L1,只能部分检查 L2 的声明;L3 与 L4 尚不能核验。以下等级是协议目标,不是对上传文件的自动认证。

L1现已支持

格式通过

文件符合声明的 Schema,并且没有明显的密钥字段。

L2部分支持

协议一致

目标是完整记录任务集、设置、模型声明与评测日期;V1 目前只检查其中部分声明。

L3尚未支持

可以重算

目标是包含足够的原始输出与评分输入,供第三方重新计算;V1 目前没有这些字段。

L4尚未支持

独立复现

目标是由独立运行方或签名来源在可比条件下复现结果;V1 目前不能核验。

本地核验能确认什么

  • 必填字段与支持的数据类型
  • 评分、运行记录、日期与哈希的内部一致性
  • 文件是否声明为演示数据
  • 没有常见 API 密钥和敏感字段

单靠本地核验不能确认什么

  • 声明的服务商或模型是否真的生成了输出
  • 评分是否没有选择偏差或薄弱测试设计
  • 一次结果是否适用于所有任务、语言、用户与未来版本
  • 模型是否适合高风险、安全或法律相关决策

公开原则

不出售排名

赞助可以披露,但不能改变评分、证据门槛或展示位置。

比较版本,不比较品牌口号

模型家族不是稳定的测试对象,必须记录准确模型 ID、设置、地区与日期。

先测真实任务,再做广泛结论

OpenGPT 先按需求缩小候选,再让用户用自己的代表性任务验证。

不确定也是结果

平局、小样本、失败运行与无法下结论的证据都应该保留。