指南与支持

OpenGPT 帮助中心

选择指南、按步骤操作,或搜索遇到的问题。

从这里开始:三个不同的作用

选择、比较和核验支持不同的决策,它们都不是通用排行榜。

1选择根据你的要求缩小模型家族的候选范围。2比较用相同任务比较准确模型版本的真实回答。3核验检查证据文件的结构与内部一致性。

01

选择 AI 模型

把 4 个实际要求转化为有解释的候选名单。

进入这个功能

这个功能用来做什么

当你知道要完成什么工作,却不知道先研究哪个模型家族时,使用模型选择助手。

开始之前

提前想清楚主要任务、允许的部署位置、最重要的运营偏好,以及语言要求。

逐步教程

  1. 1选择最接近真实工作的任务,而不是最宽泛的选项。
  2. 2设置部署边界;数据不能离开公司或设备时尤其重要。
  3. 3选择最不能妥协的优先事项,例如隐私、效率或工具生态。
  4. 4设置语言需求,然后同时阅读每个候选的匹配理由、风险与下一步验证。
  5. 5把最合适的候选带到“比较”,用相同任务测试准确的模型版本。

怎样理解结果

定性匹配标签和匹配项数量仅用于模型家族,不代表具体版本表现或基准分数。请核实所列当前版本的部署可用性,并用相同任务比较。

它不能证明什么

选择助手不会调用模型、核对实时价格,也不会给出适合所有人的冠军。同一模型家族中的不同版本可能差异很大。

常见问题: 为什么知名模型没有排在第一?

排序依据是你选择的限制条件,不是知名度。可以修改一个条件观察结果变化,再用真实任务比较具体版本。

返回顶部
02

比较两个模型

无需向 OpenGPT 提供 API 密钥,在本设备记录公平的同题比较。

进入这个功能

这个功能用来做什么

使用 3 套内置实务测试中的一套,比较两个准确的模型版本。

开始之前

你需要自行打开两个模型服务,确认准确版本与设置,移除敏感数据,并注意服务商会收到提示词且可能收费。

逐步教程

  1. 1选择两个不同的准确模型版本。
  2. 2从 3 套内置任务模板中选择一套。
  3. 3打开每个服务商链接,不修改提示词,在两个模型中分别运行。
  4. 4完整粘贴两个回答,并从事实准确、指令遵循、完整性、安全性和表达清晰度进行判断。
  5. 5完成全部测试,检查未完成项目,并下载保存在本设备的比较报告。

怎样理解结果

胜负和平局只汇总本次会话中已经完成的测试。请在备注中记录选择理由,它是理解结果的重要证据。

它不能证明什么

OpenGPT 不调用模型、不核验回答来源、不隐藏候选标签,目前也不支持自定义提示词。少量人工测试不能代表通用排行榜。

常见问题: 两个回答都有问题时怎么选择?

如果没有明确更好的回答,请选择平局,并在备注中记录各自问题。证据不足时不要强行选出胜者。

返回顶部
03

核验证据或比较报告

检查受支持 JSON 的结构、内部一致性、密钥风险模式和本地指纹。

进入这个功能

这个功能用来做什么

可以核验 OpenGPT Evidence v1/v2 证据包,也可以核验从“本地比较”下载的报告。全部检查都在当前浏览器本地完成。

开始之前

取得原始 JSON 文件。比较报告应从“本地比较”下载;如果需要完整结果而不是草稿,请先完成全部测试。

逐步教程

  1. 1选择 JSON 文件;内容只在当前浏览器处理,不会上传。
  2. 2确认工具将它识别为 Evidence v1/v2,或 OpenGPT 本地比较协议 v1/v2。
  3. 3对于证据包,检查必填字段、运行记录、时间、分数和密钥安全规则;对于比较报告,检查候选名称、任务模板、草稿或完成状态、测试是否重复,以及汇总是否与已记录的判断一致。
  4. 4阅读文件声明的摘要;如果以后需要确认审阅的是同一文件,请保存 SHA-256 本地指纹。
  5. 5如果检查失败,应修正源数据或完成缺少的比较测试,不要直接修改下载文件来强行通过。

怎样理解结果

对于 Evidence v1/v2,“通过”表示文件符合受支持的结构与一致性规则,“演示”表示它是示例。对于比较报告,“通过”表示完整报告内部一致;“草稿”表示结构有效,但比较尚未完成。“失败”表示至少一个必查项目需要处理。

它不能证明什么

检查通过不能证明所填模型确实生成了粘贴的回答、服务商声明真实,也不能证明结果适用于已记录测试之外的任务。不同文件的结果不能自动比较。

常见问题: 比较报告通过后,是否证明某个模型更好?

不能。它只确认受支持报告的结构有效且内部一致。你仍需判断模型身份、测试质量、回答内容和结果是否适用于真实决策。

返回顶部
04

浏览模型

在比较具体版本之前,先了解模型家族。

进入这个功能

这个功能用来做什么

在模型页面了解模型家族的官方定位、常见优势、已知取舍和适用任务。

开始之前

带着一个真实任务或关键限制来查看。只有模型家族名称,不足以支持采购或部署决定。

逐步教程

  1. 1按模型名称、优势、局限或任务搜索。
  2. 2阅读页面中已显示的模型资料,同时查看优势和局限。
  3. 3查看适用任务,并打开官方资料核对原始表述。
  4. 4从已展开的版本列表中选择两个准确版本。
  5. 5点击“比较所选版本”,把两个候选带入同题比较。

怎样理解结果

模型资料的作用是帮助你形成可验证的判断假设,并不是独立测得的模型能力。

它不能证明什么

服务商主张和模型家族描述不一定适用于每个新旧版本。可用性、价格、隐私和限制需要直接核对。

常见问题: 只看模型页面就能做决定吗?

可以用它建立候选名单;如果决定会影响成本、客户或数据安全,还需要用自己的任务比较准确版本。

返回顶部
05

理解评测方法

了解什么样的模型选择过程可以检查和复现。

进入这个功能

这个功能用来做什么

在设计、公开或依赖一项模型评测之前使用,避免把模型知名度误当成证据质量。

开始之前

准备一个具体决策问题、准确的模型版本、具有代表性的任务,以及保存原始回答的计划。

逐步教程

  1. 1在查看结果之前,写清楚决策问题和成功标准。
  2. 2对所有候选使用相同任务、设置和评分规则。
  3. 3保留提示词、原始回答、设置、失败记录、时间和任务集指纹。
  4. 4说明哪些环节是人工、自动、盲测、随机顺序或独立复现。
  5. 5结论必须同时说明不确定性和不能证明的内容。

怎样理解结果

证据等级是目标标准。目前支持 L1,L2 只部分支持;L3–L4 需要当前本地流程之外的能力。

它不能证明什么

严谨流程可以减少偏差,但不能保证样本代表所有用户、语言、未来模型版本或生产环境。

常见问题: 是否一定要使用最高证据等级?

根据决策后果选择。个人试用可能只需要 L1;公开或高风险主张应寻求更强的独立证据。

返回顶部

通俗术语表

遇到不熟悉的标签时,可以在这里快速查看。

需求匹配度
模型家族的定性匹配标签和匹配项数量,不用于评价具体版本。请核实所列当前版本的部署可用性,并用相同任务比较。
模型家族
一组相关模型版本;不同版本的能力可能不同。
基准评测
在明确条件下,使用可重复任务和评分规则比较系统。
证据文件
说明评测怎样运行、观察到什么的结构化记录。
Schema 格式规范
规定文件必填字段和允许值的机器可读规则。
SHA-256 指纹
用于识别完全相同文件内容的本地编号;文件变化时指纹也会变化。

常见问题排查

没有模型满足全部要求

查看每个候选被排除的原因,只放宽真正可以调整的条件。

检查需求

找不到准确版本

在模型页面检查版本列表和官方资料,不要用模型家族名称代替准确版本。

检查模型版本

比较报告显示未完成

返回所有标记的测试,补充两个完整回答并选择判断结果。

继续比较

本地草稿冲突或需要重置

返回比较页面,查看更新草稿提示,再明确选择保留或重置。

检查本地草稿

证据文件检查失败

根据失败项目修正源记录。不要加入密钥,也不要为了通过而改写结果。

打开核验工具
contact@opengpt.com

仍需帮助?

欢迎反馈失效链接、错误的模型信息或尚未解决的问题。

发送邮件