指南与支持

OpenGPT帮助中心

找到适合的操作流程,按步骤完成,并了解结果能说明什么、不能说明什么。

从你想完成的事情开始

每个流程回答不同的问题。选择最接近的目标,再按指南继续。

1模型榜单理解公开数据与模型身份。2Agent榜单根据任务和证据选择完整Agent配置。3选择模型根据真实要求缩小候选范围。4对比公开数据同时查看目录中的 2–4 个模型ID。5收藏模型在当前浏览器保存候选清单。6评测真实回答用相同任务测试两个具体版本。7提交或更正证据把模型或Agent的公开来源交给编辑审核。8核验报告分享前在本机检查OpenGPT JSON报告。

01

AI模型榜单

了解榜单排了什么、数据来自哪里,以及哪些记录带有官方模型ID。

打开

这个功能用来做什么

查看不同榜单的公开数据和原始记录,为真实任务评测建立候选名单。

开始之前

先明确你要解决的问题。用户偏好、综合能力、客观任务、成本和开放权重榜单使用不同来源与评分标准。

逐步教程

  1. 1选择最符合当前决策的榜单维度。
  2. 2查看全部记录时使用“完整来源榜单”;查看服务商资料中有模型ID的记录时使用“官方模型ID”。
  3. 3结合来源名次、评分范围、投票次数、授权方式和运行配置阅读。
  4. 4每条记录都可以打开“模型详情”。精确对应的记录进入官方详情,其余记录进入保留原始名称和配置的来源详情。
  5. 5每条记录都可以加入比较。能够完整保留配置的精确映射进入官方版本对比,其余记录在同一来源、维度和快照内进行来源记录对比。

怎样理解结果

名次只表示模型在当前来源和评测范围中的相对位置。并列会让序号跳号,不同榜单维度的分数也不能直接比较。

它不能证明什么

OpenGPT汇总第三方公开数据,并未重新运行这些评测。榜单不能证明某个模型适合所有用户或任务。

常见问题: 为什么有些记录只显示来源模型ID或来源名称?

现在每条记录都有模型详情和比较操作。只有服务商资料能证明精确对应关系时才显示官方模型ID;其余记录按来源数据对比,保留来源名称、运行配置和榜单数据,不会虚构新的官方ID。

返回顶部
02

AI智能体榜单

根据任务、完整配置、证据质量和可比结果选择Agent。

打开

这个功能用来做什么

浏览七类任务下的96条Agent评测配置,以及单独展示的109条BFCL工具调用模型结果;不同证据不会被强行合成一个分数。

开始之前

每项成绩都对应一个完整配置:基础模型、运行框架、工具、权限、预算、环境、评测版本和日期。OpenGPT保留来源公开的字段;缺失数据标为“未报告”,不会当作 0。

逐步教程

  1. 1选择最符合真实工作的任务类别。
  2. 2查看名次前,先检查评测范围、版本、评测日期、数据新鲜度和审计说明。
  3. 3通过证据等级区分已复现或已核查结果、透明公开运行和厂商自报结果。
  4. 4任务成功率、重复运行证据、耗时和人工介入率,只有在来源以相同条件公布时才比较;只有确认来源总成本与任务/运行次数使用相同口径时,才计算单次成功成本。
  5. 5关注有用配置、查看历史记录,并从同一可比组选择 2–4 项并列比较。

怎样理解结果

名次只表示一个完整系统配置在当前评测范围内的相对位置。应结合证据等级、数据新鲜度、运行次数,以及已报告的成本和可靠性阅读。

它不能证明什么

OpenGPT不制造万能Agent总分。除非明确标为“OpenGPT已复现”,其余结果是对上游公开证据的整理;任何单一评测都不能证明适合所有生产流程。

常见问题: 为什么同一个Agent或模型会出现多次?

运行框架、模型版本、工具、权限、预算或评测设置不同,就属于不同的Agent配置,必须分别记录。

返回顶部
03

提交模型或Agent

把公开身份或证据记录交给管理员审核,不直接改变榜单。

打开

这个功能用来做什么

当官方模型ID、Agent产品尚未收录,或某个公开来源需要人工核验时使用。

开始之前

先登录已验证账户,并准备公开HTTPS来源。不要提交凭据、私有文件或个人信息。

逐步教程

  1. 1在表单顶部选择“模型”或“Agent”。
  2. 2填写准确的公开名称、提供商或组织,以及表单要求的身份字段。
  3. 3选择来源类型,并链接官方文档、公开代码仓库或公开评测结果。
  4. 4说明审核员应重点核对的内容,然后只提交一次。
  5. 5在“我的近期提交”查看状态。通过的Agent产品会自动进入可搜索的Agent目录;是否具备可比数据、是否进入榜单仍需分别核验。

怎样理解结果

提交成功后会获得编号并进入审核队列。通过的Agent产品会成为公开目录记录,但不等于榜单排名或OpenGPT推荐。

它不能证明什么

提交者不能设置排名、证据等级、可比状态或公开状态。系统通过重复检查和频率限制减少滥用;审核通过也不会自动修改榜单。

常见问题: 为什么审核通过后仍没有进入榜单?

通过的Agent产品可以在目录中搜索;进入榜单仍需要可比较的公开评测证据。

返回顶部
04

榜单变化与版本记录

查看可比快照之间的真实排名变化,并比较目录中的模型ID。

打开

这个功能用来做什么

了解上一期之后哪些记录发生变化、哪些首次上榜、具体版本有何差异,以及数据何时获取。

开始之前

历史变化目前使用LMArena用户偏好榜。其他来源在取得可比的上一期快照前只显示当前数据。

逐步教程

  1. 1检查来源日期、比较基准、数据获取日和比较规则。
  2. 2“上升最快”只计算前后两期都存在的记录。
  3. 3“首次上榜”只表示新进入来源榜单,不是模型官方发布日期。
  4. 4按上升、下降、不变、首次上榜或退出榜单筛选。
  5. 5比较两个目录模型ID,并在需要审计时下载来源快照。

怎样理解结果

只有来源、范围、单位和方法一致时才计算变化;月度快照可下载核对。

它不能证明什么

只有服务商资料中注明的日期才作为产品发布日期。版本比较不会根据名称推测速度、价格、上下文长度或质量。

常见问题: 为什么Artificial Analysis和LiveBench没有排名变化?

这些来源还没有可比的上一期快照。系统会明确显示历史不足,而不会制造变化。

返回顶部
05

任务榜单

从真实工作场景开始,查看三个值得优先测试的官方模型版本。

打开

这个功能用来做什么

把较宽泛的公开数据转化为适用于编程、研究、文档、客服、多语言、多模态、成本、私有部署或高速任务的简洁候选名单。

开始之前

选择最接近真实工作的场景,并明确你的提示词、数据、工具、地区、预算和隐私要求。页面引用的公开数据范围可能比当前任务更宽。

逐步教程

  1. 1打开最接近当前决策的任务场景。
  2. 2阅读三个官方版本的入选原因和仍需验证的部分。
  3. 3检查每个候选的公开来源、来源排名或原始值、映射核实日期和数据截止日。
  4. 4选择两个或三个候选,进行公开数据并列对比。
  5. 5用前两个候选打开真实任务评测,编辑示例任务集,并在可比设置下测试。

怎样理解结果

你会得到三个官方起始候选、可用的公开依据,以及继续进行数据对比和真实任务测试的入口。

它不能证明什么

任务榜单只是起始候选,不是万能排名,也不能证明哪个模型最好。缺失数据不会按 0 计算,不同公开来源也不会合并成一个分数。

常见问题: 为什么起始候选中可能有暂时没有公开结果的模型?

某个官方版本可能因产品定位或部署方式适合该任务,但所选公开来源尚未映射到这个具体版本。系统会明确保留缺失状态,最终仍需用你的任务验证。

返回顶部
06

模型升级雷达

设置当前模型、常用任务和关注重点,只查看真正值得进行公平对比的变化。

打开

这个功能用来做什么

回答一个实际问题:公开可比数据是否足以支持你测试当前模型的替代方案。

开始之前

选择具体官方版本、至少一个常用任务,以及最多两个关注重点。设置仅保存在当前设备。

逐步教程

  1. 1选择当前使用的具体官方版本;收藏模型不会自动被视为当前模型。
  2. 2选择常用任务,并从效果、成本、速度、隐私和长上下文中选择最多两个重点。
  3. 3查看每个模型是值得对比、继续观察,还是需要准备替代方案。
  4. 4先检查同一量尺的公开数据,再用真实任务让两个模型完成相同工作。
  5. 5定期查看公开变化,或订阅榜单变化RSS。

怎样理解结果

升级雷达会生成仅保存在本设备的检查结果,包括当前模型、任务匹配的替代方案、数据日期、不确定性边界和对比入口。

它不能证明什么

升级检查不是换模指令。缺少可比数据的条件仍需直接实测,本地设置不会同步或备份。

常见问题: “值得对比”是不是代表应该替换当前模型?

不是。它表示同任务测试值得进行。只有替代模型在你的真实任务和约束中表现更好时,才应考虑更换。

返回顶部
07

选择模型

把 4 个实际要求转化为有解释的候选名单。

打开

这个功能用来做什么

当你知道要完成什么工作,却不知道先研究哪个模型系列时,使用模型选择助手。

开始之前

提前想清楚主要任务、允许的部署位置、最重要的运营偏好,以及语言要求。

逐步教程

  1. 1选择最接近真实工作的任务,而不是最宽泛的选项。
  2. 2设置部署边界;数据不能离开公司或设备时尤其重要。
  3. 3选择最不能妥协的优先事项,例如隐私、效率或工具生态。
  4. 4设置语言需求,然后同时阅读每个候选的匹配理由、风险与下一步验证。
  5. 5把最合适的候选带到“真实任务评测”,用相同任务测试准确的模型版本。

怎样理解结果

定性匹配标签和匹配项数量仅用于模型系列,不代表具体版本表现或基准分数。请核实所列当前版本的部署可用性,并用相同任务比较。

它不能证明什么

选择助手不会调用模型、核对实时价格,也不会给出适合所有人的冠军。同一模型系列中的不同版本可能差异很大。

常见问题: 为什么知名模型没有排在第一?

排序依据是你选择的限制条件,不是知名度。可以修改一个条件观察结果变化,再用真实任务比较具体版本。

返回顶部
08

模型目录与详情

查找服务商资料中的模型ID,打开独立详情页,并查看是否已有可比的公开排名数据。

打开

这个功能用来做什么

需要准确的官方模型ID、服务商入口、适用与不适用任务、资料来源和排名数据状态时,使用模型目录。

开始之前

准备模型名称、服务商、部署要求或任务。服务商资料中有模型ID,并不代表一定存在可比的公开评测数据。

逐步教程

  1. 1按模型、版本、服务商或任务搜索。
  2. 2按部署方式,以及“已纳入排名”或“暂未排名”筛选。
  3. 3打开详情页,查看身份、用途、公开数据覆盖、优势、局限、来源与核实日期。
  4. 4通过官方入口核对当前可用性、价格、隐私和限制。
  5. 5将目录中的 2–4 个版本加入数据对比,再把两个最终候选带到真实任务评测。

怎样理解结果

“已纳入排名”表示可比公开数据已对应到该模型ID;“暂未排名”表示本期没有适用的可比记录,并不等于零分。

它不能证明什么

服务商资料用于确认目录身份,不代表该版本目前在所有国家或服务档位都可用。榜单覆盖和服务条款可能在核实日期之后变化。

常见问题: “暂未排名”是否代表模型较弱?

不是。它只表示本期没有适用于该模型ID的可比公开数据。如果仍符合需求,请用真实任务直接验证。

返回顶部
09

数据对比

可以对比 2–4 个具体官方版本,也可以对比同一公开榜单中的来源记录。

打开

这个功能用来做什么

官方版本对比用于整理服务商资料中的模型ID;如果转换成官方版本会丢失来源配置,则使用来源记录对比保留发布名称和设置。

开始之前

官方版本请选择 2–4 个目录ID;来源记录请选择同一来源、榜单维度和快照中的 2–4 条记录。

逐步教程

  1. 1榜单中的每条记录都可以加入比较。能够完整保留配置的精确映射使用官方版本对比,其余使用来源记录对比。
  2. 2官方版本的数据按来源和维度分开显示。
  3. 3来源记录对比保留发布名称、配置、名次和分数,并使用同一来源量表。
  4. 4缺失数据仍表示未知,不按 0 分处理。
  5. 5只有精确官方版本可以在选出两个候选后进入真实任务评测。

怎样理解结果

数据对比会形成一份有来源依据的候选清单,并清楚显示信息缺口;它不会生成新的基准分数,也不会宣布适合所有人的冠军。

它不能证明什么

这个功能不会调用模型。不同来源或评测范围的分数不能直接互换,模型资料也可能在核实日期之后发生变化。

常见问题: 公开数据对比和真实任务评测有什么区别?

公开数据对比整理 2–4 个模型已经发布的信息;真实任务评测只接收两个具体版本,需要你在两个服务中运行相同提示词,再隐藏模型名评审粘贴的回答。

返回顶部
10

已存模型

把榜单中的候选收藏到当前浏览器,形成一个简单的工作清单。

打开

这个功能用来做什么

用“已存模型”快速返回候选、打开可信的官方入口,并把支持的模型ID加入比较。

开始之前

请使用同一浏览器和设备。这个清单保存在本地,不需要OpenGPT账号,也不会同步到云端。

逐步教程

  1. 1在任意榜单记录上点击“收藏”。
  2. 2从顶部导航打开“已存模型”,查看已收藏记录。
  3. 3所有来源记录都显示来源模型ID或来源名称;有官方模型ID的记录可以打开服务商入口或加入比较。
  4. 4加入两个不同且支持比较的模型ID,然后打开数据对比;选出最终两个候选后,再进入真实任务评测。
  5. 5移除不再需要的记录。在同一浏览器中刷新页面或切换网站语言,清单仍会保留。

怎样理解结果

“已存模型”旁的数字表示已收藏数量。来源身份与官方模型身份始终分开保存。

它不能证明什么

这不是账号、书签同步或云端备份。其他浏览器或设备无法看到;无痕模式、浏览器限制存储或清除网站数据都可能导致清单丢失。

常见问题: 为什么收藏的模型不见了?

请确认仍在使用同一设备和浏览器配置。如果网站数据已被清除或浏览器阻止本地存储,OpenGPT无法恢复这个本地清单。

返回顶部
11

真实任务评测

使用真实任务,并把决策项目保存在本设备。

打开

这个功能用来做什么

用模板或可编辑的自定义任务比较两个具体版本。

开始之前

请选择两个不同、支持相同任务流程的目录模型ID。请自行打开两个服务商,核对版本与设置并移除敏感数据;提交内容受相应服务商政策约束。

逐步教程

  1. 1从模型目录、榜单或“我的模型”选择两个支持比较的具体版本;同一官方版本不能同时作为两个候选。
  2. 2载入模板,或添加、编辑自己的任务。
  3. 3在两个服务中运行同一提示词并粘贴完整回答。
  4. 4隐藏模型名后比较回答;完成五项评分,选择回答 1、回答 2 或平局,并添加备注。
  5. 5全部判断完成后统一揭晓,再下载V3 报告或在本地核验。

怎样理解结果

综合判断决定逐题结果。差异较小或完成任务少于 3 个时,结果保持证据不足。

它不能证明什么

隐藏名称仅减少可见标签偏差;不是双盲或独立运行,也不核验回答来源或建立通用排名。

常见问题: 为什么有些记录不能加入数据对比?

没有服务商目录模型ID的来源记录不能加入目录数据对比。同一模型也可能已经选择,或当前清单已达到 4 个模型上限。

返回顶部
12

保存任务集与重新评估

复用同一组真实提示词,在以后评测模型时无需重新建立任务集。

打开

这个功能用来做什么

让后续比较保持更一致的测试条件,并在模型更新或公开数据变化后重新评估具体版本。

开始之前

完成任务标题和提示词,填写容易识别的任务集名称,并使用同一设备和浏览器。任务集可能包含真实工作内容,保存前请删除敏感信息。

逐步教程

  1. 1在真实任务评测中,准备或编辑一组能够代表实际工作的任务。
  2. 2填写容易识别的名称并保存任务集。
  3. 3以后从已保存任务集中选择并载入当前评测。
  4. 4选择两个具体模型版本,在可比设置下运行全部提示词。
  5. 5完成一轮评测后选择“重新评估”,保留任务和具体版本,同时清空旧回答、判断和旧报告。

怎样理解结果

任务集名称、模板、语言、任务标题和提示词会保存在本设备,供以后复用。重新评估会保留测试输入,并开始一轮干净的新测试。

它不能证明什么

任务集仅保存在本设备,不会同步或备份。任务集不会保存回答、模型选择、评审、报告或API密钥;清除网站数据后,全部任务集可能消失。

常见问题: 选择“重新评估”后会发生什么?

系统会保留同一组任务和两个具体模型版本,清空旧回答、评分、判断、揭晓状态和报告,使新一轮测试不受旧结果影响。

返回顶部
13

可分享决策报告

用不含敏感内容的链接分享官方模型候选和公开数据截止日。

打开

这个功能用来做什么

用于说明正在考虑的任务、具体官方版本、已有公开数据,以及可选的最终候选。

开始之前

从任务榜单创建报告;分享前确认任务、具体模型ID、数据截止日和可选的最终选择。

逐步教程

  1. 1从任务榜单选择两个或三个官方候选并创建报告。
  2. 2可以把一个模型标为最终候选,也可以暂不选择。
  3. 3检查公开数据覆盖和报告的适用边界。
  4. 4复制链接、使用设备分享、打印,或下载已去除敏感内容的JSON记录。
  5. 5接收者可以打开相同候选,继续公开数据对比或真实任务评测。

怎样理解结果

分享链接只携带任务ID、具体官方模型ID、公开数据截止日和可选的最终选择,接收者可以查看同一候选清单。

它不能证明什么

分享报告不包含提示词、模型回答、备注、API密钥或完整评测报告,也不能证明某个模型是万能冠军或回答确实来自所填服务商。

常见问题: 别人能通过分享链接看到我的评测内容吗?

不能。提示词、回答、备注、API密钥和本地评测项目都不会加入链接。如在受支持流程外自行添加了信息,请在分享前检查链接内容。

返回顶部
14

报告核验

检查受支持JSON的结构、内部一致性、密钥风险模式和本地指纹。

打开

这个功能用来做什么

可以核验OpenGPT Evidence v1/v2 证据包,也可以核验从“决策工作台”下载的V3 报告。全部检查都在当前浏览器本地完成。

开始之前

取得原始JSON文件。比较报告应从“决策工作台”下载;如果需要完整结果而不是草稿,请先完成全部测试。

逐步教程

  1. 1选择JSON文件;内容只在当前浏览器处理,不会上传。
  2. 2确认工具将它识别为Evidence v1/v2,或OpenGPT本地比较协议v1/v2 或决策工作台v3。
  3. 3对于证据包,检查必填字段、运行记录、时间、分数和密钥安全规则;对于比较报告,检查候选名称、任务模板、草稿或完成状态、测试是否重复,以及汇总是否与已记录的判断一致。
  4. 4阅读文件声明的摘要;如果以后需要确认审阅的是同一文件,请保存SHA-256 本地指纹。
  5. 5如果检查失败,应修正源数据或完成缺少的比较测试,不要直接修改下载文件来强行通过。

怎样理解结果

对于Evidence v1/v2,“通过”表示文件符合受支持的结构与一致性规则,“演示”表示它是示例。对于比较报告,“通过”表示完整报告内部一致;“草稿”表示结构有效,但比较尚未完成。“失败”表示至少一个必查项目需要处理。

它不能证明什么

检查通过不能证明所填模型确实生成了粘贴的回答、服务商声明真实,也不能证明结果适用于已记录测试之外的任务。不同文件的结果不能自动比较。

常见问题: 比较报告通过后,是否证明某个模型更好?

不能。它只确认受支持报告的结构有效且内部一致。你仍需判断模型身份、测试质量、回答内容和结果是否适用于真实决策。

返回顶部
15

评测方法

了解什么样的模型选择过程可以检查和复现。

打开

这个功能用来做什么

在设计、公开或依赖一项模型评测之前使用,避免把模型知名度误当成证据质量。

开始之前

准备一个具体决策问题、准确的模型版本、具有代表性的任务,以及保存原始回答的计划。

逐步教程

  1. 1在查看结果之前,写清楚决策问题和成功标准。
  2. 2对所有候选使用相同任务、设置和评分规则。
  3. 3保留提示词、原始回答、设置、失败记录、时间和任务集指纹。
  4. 4说明哪些环节是人工、自动、隐藏模型名后评审、随机顺序或独立复现。
  5. 5结论必须同时说明不确定性和不能证明的内容。

怎样理解结果

Evidence v1/v2 主要检查格式与声明;“决策工作台”V3 支持本地重算(L3),但仍不支持L4 独立复现。

它不能证明什么

严谨流程可以减少偏差,但不能保证样本代表所有用户、语言、未来模型版本或生产环境。

常见问题: 是否一定要使用最高证据等级?

根据决策后果选择。个人试用可能只需要L1;公开或高风险主张应寻求更强的独立证据。

返回顶部

通俗术语表

遇到不熟悉的标签时,可以在这里快速查看。

来源记录
公开榜单中的一条原始记录,保留来源模型ID或名称,便于查看和审计。
官方模型ID
服务商资料中列出的模型标识,与来源记录名称分开显示。
目录版本
根据服务商资料收录,并带有官方入口和核实来源的模型版本。
评分范围
公开数据给出的评分不确定范围。范围越宽,精度越低;不同榜单来源的范围不能直接比较。
我的模型
仅保存在当前浏览器的候选清单,不是账号、云同步或服务商书签。
需求匹配度
模型系列的定性匹配标签和匹配项数量,不用于评价具体版本。请用相同任务比较具体版本。
模型系列
一组相关模型版本;不同版本的能力、价格和访问方式可能不同。
基准评测
在明确条件下,使用可重复任务和评分规则比较系统。
Agent配置
产生一项结果的基础模型、运行框架、工具、权限、预算、环境、评测版本和日期的组合。
证据等级
说明结果如何产生或核查的标签,不会改变来源原始成绩。
单次成功成本
已报告评测成本除以成功任务数;只在存在可比来源数据时显示,缺失成本不会当作 0。
评测文件
说明评测怎样运行、观察到什么的结构化记录。
文件格式规范
规定文件必填字段和允许值的机器可读规则。
SHA-256指纹
用于识别完全相同文件内容的本地编号;文件变化时指纹也会变化。

问题排查

没有模型满足全部要求

查看每个候选被排除的原因,只放宽真正可以调整的条件。

检查需求

榜单序号出现跳号

公开来源可能存在并列名次或多个运行配置。OpenGPT保留来源位置,不会为了连续显示而重新编号。

榜单说明

Agent的成本或可靠性缺失

来源没有发布可比数据。OpenGPT会保留“未报告”,不会把缺失数据当作 0;请只比较同一评测范围内已有的数值。

查看Agent证据

记录没有官方模型ID

这不是未完成状态,而是已经归类的来源记录。可打开原始来源查看;需要官方模型ID时,请使用模型目录。

来源身份说明

“我的模型”为空或记录消失

请使用同一设备和浏览器配置。无痕模式、浏览器阻止存储或清除网站数据,都可能移除本地清单。

我的模型

记录无法加入数据对比

数据对比使用目录中的模型ID。同一版本可能已经选择,或清单已达到 4 个版本上限。请选择其他目录版本,或先移除一个候选。

打开模型目录

比较报告显示未完成

返回所有标记的测试,补充两个完整回答并选择判断结果。

继续比较

本地草稿冲突或需要重置

返回比较页面,查看更新草稿提示,再明确选择保留或重置。

检查本地草稿

证据文件检查失败

根据失败项目修正源记录。不要加入密钥,也不要为了通过而改写结果。

核验工具
contact@opengpt.com

仍需帮助?

欢迎反馈失效链接、错误的模型信息或尚未解决的问题。

发送邮件