模型选择是否可信,取决于证据是否可信。
OpenGPT 把需求匹配、亲自比较和公开证据分开。每个结论都应说明测了什么、在什么条件下测,以及哪些部分仍未验证。
从真实任务到可复核结论
先冻结问题
比较前记录任务、成功标准、输入、约束、模型版本、日期与设置。
在相同条件下运行
所有候选使用同一任务和评分标准。需要盲测偏好时,请使用外部随机化工具;当前私有比较不会隐藏模型名称。
保留原始证据
保存提示词、输出、评分、错误、延迟与哈希;缺失的证据不能用估算补齐。
公开结论边界
说明不确定性、样本量、排除项、利益关系,以及结果不能证明什么。
证据等级目标标准
当前本地核验器完整支持 L1,只能部分检查 L2 的声明;L3 与 L4 尚不能核验。以下等级是协议目标,不是对上传文件的自动认证。
格式通过
文件符合声明的 Schema,并且没有明显的密钥字段。
协议一致
目标是完整记录任务集、设置、模型声明与评测日期;V1 目前只检查其中部分声明。
可以重算
目标是包含足够的原始输出与评分输入,供第三方重新计算;V1 目前没有这些字段。
独立复现
目标是由独立运行方或签名来源在可比条件下复现结果;V1 目前不能核验。
本地核验能确认什么
- ✓必填字段与支持的数据类型
- ✓评分、运行记录、日期与哈希的内部一致性
- ✓文件是否声明为演示数据
- ✓没有常见 API 密钥和敏感字段
单靠本地核验不能确认什么
- —声明的服务商或模型是否真的生成了输出
- —评分是否没有选择偏差或薄弱测试设计
- —一次结果是否适用于所有任务、语言、用户与未来版本
- —模型是否适合高风险、安全或法律相关决策
公开原则
不出售排名
赞助可以披露,但不能改变评分、证据门槛或展示位置。
比较版本,不比较品牌口号
模型家族不是稳定的测试对象,必须记录准确模型 ID、设置、地区与日期。
先测真实任务,再做广泛结论
OpenGPT 先按需求缩小候选,再让用户用自己的代表性任务验证。
不确定也是结果
平局、小样本、失败运行与无法下结论的证据都应该保留。