没有模型满足全部要求
查看每个候选被排除的原因,只放宽真正可以调整的条件。
检查需求找到适合的操作流程,按步骤完成,并了解结果能说明什么、不能说明什么。
每个流程回答不同的问题。选择最接近的目标,再按指南继续。
了解榜单排了什么、数据来自哪里,以及哪些记录带有官方模型ID。
查看不同榜单的公开数据和原始记录,为真实任务评测建立候选名单。
先明确你要解决的问题。用户偏好、综合能力、客观任务、成本和开放权重榜单使用不同来源与评分标准。
名次只表示模型在当前来源和评测范围中的相对位置。并列会让序号跳号,不同榜单维度的分数也不能直接比较。
OpenGPT汇总第三方公开数据,并未重新运行这些评测。榜单不能证明某个模型适合所有用户或任务。
现在每条记录都有模型详情和比较操作。只有服务商资料能证明精确对应关系时才显示官方模型ID;其余记录按来源数据对比,保留来源名称、运行配置和榜单数据,不会虚构新的官方ID。
根据任务、完整配置、证据质量和可比结果选择Agent。
浏览七类任务下的96条Agent评测配置,以及单独展示的109条BFCL工具调用模型结果;不同证据不会被强行合成一个分数。
每项成绩都对应一个完整配置:基础模型、运行框架、工具、权限、预算、环境、评测版本和日期。OpenGPT保留来源公开的字段;缺失数据标为“未报告”,不会当作 0。
名次只表示一个完整系统配置在当前评测范围内的相对位置。应结合证据等级、数据新鲜度、运行次数,以及已报告的成本和可靠性阅读。
OpenGPT不制造万能Agent总分。除非明确标为“OpenGPT已复现”,其余结果是对上游公开证据的整理;任何单一评测都不能证明适合所有生产流程。
运行框架、模型版本、工具、权限、预算或评测设置不同,就属于不同的Agent配置,必须分别记录。
把公开身份或证据记录交给管理员审核,不直接改变榜单。
当官方模型ID、Agent产品尚未收录,或某个公开来源需要人工核验时使用。
先登录已验证账户,并准备公开HTTPS来源。不要提交凭据、私有文件或个人信息。
提交成功后会获得编号并进入审核队列。通过的Agent产品会成为公开目录记录,但不等于榜单排名或OpenGPT推荐。
提交者不能设置排名、证据等级、可比状态或公开状态。系统通过重复检查和频率限制减少滥用;审核通过也不会自动修改榜单。
通过的Agent产品可以在目录中搜索;进入榜单仍需要可比较的公开评测证据。
查看可比快照之间的真实排名变化,并比较目录中的模型ID。
了解上一期之后哪些记录发生变化、哪些首次上榜、具体版本有何差异,以及数据何时获取。
历史变化目前使用LMArena用户偏好榜。其他来源在取得可比的上一期快照前只显示当前数据。
只有来源、范围、单位和方法一致时才计算变化;月度快照可下载核对。
只有服务商资料中注明的日期才作为产品发布日期。版本比较不会根据名称推测速度、价格、上下文长度或质量。
这些来源还没有可比的上一期快照。系统会明确显示历史不足,而不会制造变化。
从真实工作场景开始,查看三个值得优先测试的官方模型版本。
把较宽泛的公开数据转化为适用于编程、研究、文档、客服、多语言、多模态、成本、私有部署或高速任务的简洁候选名单。
选择最接近真实工作的场景,并明确你的提示词、数据、工具、地区、预算和隐私要求。页面引用的公开数据范围可能比当前任务更宽。
你会得到三个官方起始候选、可用的公开依据,以及继续进行数据对比和真实任务测试的入口。
任务榜单只是起始候选,不是万能排名,也不能证明哪个模型最好。缺失数据不会按 0 计算,不同公开来源也不会合并成一个分数。
某个官方版本可能因产品定位或部署方式适合该任务,但所选公开来源尚未映射到这个具体版本。系统会明确保留缺失状态,最终仍需用你的任务验证。
设置当前模型、常用任务和关注重点,只查看真正值得进行公平对比的变化。
回答一个实际问题:公开可比数据是否足以支持你测试当前模型的替代方案。
选择具体官方版本、至少一个常用任务,以及最多两个关注重点。设置仅保存在当前设备。
升级雷达会生成仅保存在本设备的检查结果,包括当前模型、任务匹配的替代方案、数据日期、不确定性边界和对比入口。
升级检查不是换模指令。缺少可比数据的条件仍需直接实测,本地设置不会同步或备份。
不是。它表示同任务测试值得进行。只有替代模型在你的真实任务和约束中表现更好时,才应考虑更换。
把 4 个实际要求转化为有解释的候选名单。
当你知道要完成什么工作,却不知道先研究哪个模型系列时,使用模型选择助手。
提前想清楚主要任务、允许的部署位置、最重要的运营偏好,以及语言要求。
定性匹配标签和匹配项数量仅用于模型系列,不代表具体版本表现或基准分数。请核实所列当前版本的部署可用性,并用相同任务比较。
选择助手不会调用模型、核对实时价格,也不会给出适合所有人的冠军。同一模型系列中的不同版本可能差异很大。
排序依据是你选择的限制条件,不是知名度。可以修改一个条件观察结果变化,再用真实任务比较具体版本。
查找服务商资料中的模型ID,打开独立详情页,并查看是否已有可比的公开排名数据。
需要准确的官方模型ID、服务商入口、适用与不适用任务、资料来源和排名数据状态时,使用模型目录。
准备模型名称、服务商、部署要求或任务。服务商资料中有模型ID,并不代表一定存在可比的公开评测数据。
“已纳入排名”表示可比公开数据已对应到该模型ID;“暂未排名”表示本期没有适用的可比记录,并不等于零分。
服务商资料用于确认目录身份,不代表该版本目前在所有国家或服务档位都可用。榜单覆盖和服务条款可能在核实日期之后变化。
不是。它只表示本期没有适用于该模型ID的可比公开数据。如果仍符合需求,请用真实任务直接验证。
可以对比 2–4 个具体官方版本,也可以对比同一公开榜单中的来源记录。
官方版本对比用于整理服务商资料中的模型ID;如果转换成官方版本会丢失来源配置,则使用来源记录对比保留发布名称和设置。
官方版本请选择 2–4 个目录ID;来源记录请选择同一来源、榜单维度和快照中的 2–4 条记录。
数据对比会形成一份有来源依据的候选清单,并清楚显示信息缺口;它不会生成新的基准分数,也不会宣布适合所有人的冠军。
这个功能不会调用模型。不同来源或评测范围的分数不能直接互换,模型资料也可能在核实日期之后发生变化。
公开数据对比整理 2–4 个模型已经发布的信息;真实任务评测只接收两个具体版本,需要你在两个服务中运行相同提示词,再隐藏模型名评审粘贴的回答。
把榜单中的候选收藏到当前浏览器,形成一个简单的工作清单。
用“已存模型”快速返回候选、打开可信的官方入口,并把支持的模型ID加入比较。
请使用同一浏览器和设备。这个清单保存在本地,不需要OpenGPT账号,也不会同步到云端。
“已存模型”旁的数字表示已收藏数量。来源身份与官方模型身份始终分开保存。
这不是账号、书签同步或云端备份。其他浏览器或设备无法看到;无痕模式、浏览器限制存储或清除网站数据都可能导致清单丢失。
请确认仍在使用同一设备和浏览器配置。如果网站数据已被清除或浏览器阻止本地存储,OpenGPT无法恢复这个本地清单。
使用真实任务,并把决策项目保存在本设备。
用模板或可编辑的自定义任务比较两个具体版本。
请选择两个不同、支持相同任务流程的目录模型ID。请自行打开两个服务商,核对版本与设置并移除敏感数据;提交内容受相应服务商政策约束。
综合判断决定逐题结果。差异较小或完成任务少于 3 个时,结果保持证据不足。
隐藏名称仅减少可见标签偏差;不是双盲或独立运行,也不核验回答来源或建立通用排名。
没有服务商目录模型ID的来源记录不能加入目录数据对比。同一模型也可能已经选择,或当前清单已达到 4 个模型上限。
复用同一组真实提示词,在以后评测模型时无需重新建立任务集。
让后续比较保持更一致的测试条件,并在模型更新或公开数据变化后重新评估具体版本。
完成任务标题和提示词,填写容易识别的任务集名称,并使用同一设备和浏览器。任务集可能包含真实工作内容,保存前请删除敏感信息。
任务集名称、模板、语言、任务标题和提示词会保存在本设备,供以后复用。重新评估会保留测试输入,并开始一轮干净的新测试。
任务集仅保存在本设备,不会同步或备份。任务集不会保存回答、模型选择、评审、报告或API密钥;清除网站数据后,全部任务集可能消失。
系统会保留同一组任务和两个具体模型版本,清空旧回答、评分、判断、揭晓状态和报告,使新一轮测试不受旧结果影响。
检查受支持JSON的结构、内部一致性、密钥风险模式和本地指纹。
可以核验OpenGPT Evidence v1/v2 证据包,也可以核验从“决策工作台”下载的V3 报告。全部检查都在当前浏览器本地完成。
取得原始JSON文件。比较报告应从“决策工作台”下载;如果需要完整结果而不是草稿,请先完成全部测试。
对于Evidence v1/v2,“通过”表示文件符合受支持的结构与一致性规则,“演示”表示它是示例。对于比较报告,“通过”表示完整报告内部一致;“草稿”表示结构有效,但比较尚未完成。“失败”表示至少一个必查项目需要处理。
检查通过不能证明所填模型确实生成了粘贴的回答、服务商声明真实,也不能证明结果适用于已记录测试之外的任务。不同文件的结果不能自动比较。
不能。它只确认受支持报告的结构有效且内部一致。你仍需判断模型身份、测试质量、回答内容和结果是否适用于真实决策。
了解什么样的模型选择过程可以检查和复现。
在设计、公开或依赖一项模型评测之前使用,避免把模型知名度误当成证据质量。
准备一个具体决策问题、准确的模型版本、具有代表性的任务,以及保存原始回答的计划。
Evidence v1/v2 主要检查格式与声明;“决策工作台”V3 支持本地重算(L3),但仍不支持L4 独立复现。
严谨流程可以减少偏差,但不能保证样本代表所有用户、语言、未来模型版本或生产环境。
根据决策后果选择。个人试用可能只需要L1;公开或高风险主张应寻求更强的独立证据。
遇到不熟悉的标签时,可以在这里快速查看。
查看每个候选被排除的原因,只放宽真正可以调整的条件。
检查需求公开来源可能存在并列名次或多个运行配置。OpenGPT保留来源位置,不会为了连续显示而重新编号。
榜单说明来源没有发布可比数据。OpenGPT会保留“未报告”,不会把缺失数据当作 0;请只比较同一评测范围内已有的数值。
查看Agent证据这不是未完成状态,而是已经归类的来源记录。可打开原始来源查看;需要官方模型ID时,请使用模型目录。
来源身份说明请使用同一设备和浏览器配置。无痕模式、浏览器阻止存储或清除网站数据,都可能移除本地清单。
我的模型数据对比使用目录中的模型ID。同一版本可能已经选择,或清单已达到 4 个版本上限。请选择其他目录版本,或先移除一个候选。
打开模型目录返回所有标记的测试,补充两个完整回答并选择判断结果。
继续比较返回比较页面,查看更新草稿提示,再明确选择保留或重置。
检查本地草稿根据失败项目修正源记录。不要加入密钥,也不要为了通过而改写结果。
核验工具欢迎反馈失效链接、错误的模型信息或尚未解决的问题。