公开一条推荐如何成为决策。
OpenGPT是AI Decision Intelligence Platform。我们将编辑需求匹配、事实来源、真实任务评测和公开基准证据分开,让每个结果都能说明条件与边界。
一分钟看懂方法
- 名次只表示模型在某个来源和范围内的相对位置,不是万能总分。
- 比较对象必须是具体模型版本或完整Agent配置。
- 缺失或不可比的数据继续标为未知,不会变成 0 或强行合并排名。
- 本地报告核验能确认结构与内部一致性,不能证明输出来源或服务商真实性。
编辑匹配分 · editorial-fit-v1
0–10编辑匹配分如何产生
八个目录信号用于逐维度比较。它们是独立记录的OpenGPT编辑判断层,与rules-v2推荐加分和公共基准证据分开。
编辑产品匹配分:10表示更符合所列维度;各维度同等展示,绝不合并成总冠军。
综合能力
0–10根据公开能力、目录角色和已知产品限制,编辑判断其对广泛复杂工作的适用性;不是智商或基准分数。
编程
0–10编辑判断其对软件规划、实现、调试、审核和代码库工作的适用性;不是实测通过率。
推理
0–10编辑判断其对多步分析、约束处理和结构化解题的适用性;不是复现后的推理基准。
写作
0–10编辑判断其对起草、编辑、长文与文档工作的适用性;不是文风或事实性的实测结果。
速度
0–10根据产品定位和交付方式编辑判断其快速迭代适用性;不是实测延迟主张。
成本效率
0–10根据标示档位和部署方式编辑判断其价格与运营成本可控性;不是总成本计算或价格保证。
隐私控制
0–10根据本地、混合或云分类编辑判断其部署与数据控制适用性;不是安全、合规或遥测审计。
生态
0–10编辑判断其对可用工具、集成、平台和部署选项的适用性;不是市场份额或集成质量实测。
权重与汇总
各维度的展示权重相同,但没有算术权重、平均分、总分或总冠军;用户根据声明条件决定哪些维度重要。
人工编辑判断边界
编辑依据rubric、服务商确认的产品事实和目录分类给出0–10整数。它不是具体版本实测、基准结果、概率或服务商保证。
来源
服务商官方页面支持身份、访问、公开能力、部署选项和标示价格;适用标签、优势、弱点、分类及全部0–10分均属OpenGPT编辑输入。
目录审核
目录最后审核:
置信度: 编辑覆盖完整度:中
置信度描述目录覆盖与解释的完整性,不表示表现良好的概率。服务商事实可能变化,匹配信号也没有经过独立实测。
适用范围
用于在当前产品与部署假设下,按具名维度比较目录记录;不要把分差当成实测性能差异。
采用前,请核实当前服务商事实,并测试具体模型版本、服务档位、工具、地区与代表性真实工作。
公开方法 · rules-v2
OpenGPT如何生成推荐
AI组合构建器把本地AI资料转成确定性候选清单。以下分数在预算和隐私硬门槛之后排列编辑产品匹配度,并不衡量模型质量。
评分维度与加分规则
分数是条件权重,不是百分比;硬门槛会在评分前排除不合格项目。
任务与目标匹配
模型 · 工具模型每匹配一个所选任务加12分,精确匹配目标加10分;工具每匹配一个用途加10分。
用户声明条件 · OpenGPT编辑目录隐私与部署
模型 · 工具高隐私会排除非本地模型和非高隐私工具;合格本地模型加30分、高隐私工具加12分。中等隐私下,混合/本地/云模型分别加8/5/2分。
用户声明条件 · OpenGPT编辑目录预算资格
模型 · 工具超出所选标示价格范围的项目会被排除;合格模型加12分、工具加8分,免费档且标有免费入口的模型再加16分。
用户声明条件 · 服务商公开事实 · OpenGPT编辑目录职业匹配
模型 · 工具学生与模型匹配加10分,其他已支持的模型职业匹配加8分;学生与工具匹配加8分,其他工具职业匹配加6分。
用户声明条件 · OpenGPT编辑目录行业信号
模型 · 工具识别出的行业词会映射为任务类别;模型每项匹配加5分、工具加4分,自由文本本身不会复制进工作流。
用户声明条件 · OpenGPT编辑目录语言匹配
模型偏好非英语时,多语言目录匹配加14分,不匹配减3分;偏好英语时,写作或文档匹配加3分。
用户声明条件 · OpenGPT编辑目录平台匹配
模型 · 工具模型匹配权重为网页+3、桌面+10、终端+8、API+7、移动端+9;工具每个平台匹配加7分,无匹配减3分。
用户声明条件 · OpenGPT编辑目录经验匹配
模型 · 工具入门模型匹配加10分(本地模型不匹配减4分),高级匹配加7分,中级的前沿/混合模型匹配加2分;入门/高级工具匹配分别加6/5分。
用户声明条件 · OpenGPT编辑目录选择与同分
模型 · 工具合格候选按规则分排序,同分按名称排序;角色按固定顺序填充,剩余匹配模型最多取三个作为替代项。
确定性rules-v2来源与主张边界
服务商公开事实
官方页面用于支持身份、访问方式、公开能力描述和标示价格;OpenGPT不把它们当作独立性能测试。
OpenGPT编辑目录
适用标签、优势、隐私/部署分类和产品匹配信号属于经审核的编辑判断,不是基准实测或服务商保证。
用户声明条件
目标、任务、职业、预算、隐私、语言、平台、经验和行业信号来自用户本地资料,属于适用条件,不是外部证据。
确定性rules-v2
相同的标准化资料和目录快照会产生相同排序;计算可解释,但确定性不会把编辑输入变成事实。
公开基准背景
公开榜单是独立证据;rules-v2 不把基准名次或分数加入推荐分,应在筛选后按各来源范围查看。
事实与编辑判断
事实主张必须能追溯到具名服务商或基准来源、可用时的精确身份和审核日期。
适用标签、优势、分类、假设、置信度和推荐属于OpenGPT编辑判断,不得包装成具体版本的实测结果。
审核周期与置信度
方法与有效推荐记录计划至少每90天审核一次,发生重大变化时也会触发审核。每个结果必须使用自身记录的审核日期,而不是本页日期。
以下情况触发审核
- 服务商更改模型ID、生命周期、访问方式、能力说明或标示价格时。
- 推荐引擎、权重、硬门槛或编辑分类发生变化时。
- 更正发现重要来源、身份、价格、隐私或适用性错误时。
置信度规则
置信度描述匹配解释及其支撑记录的完整性,不表示模型表现良好的概率。
- 高
- 有精确身份和当前事实来源,重要字段已核实,假设已展示,并提供合格替代项。
- 中
- 匹配理由可解释,但采用前仍需确认至少一个来源、条件或当前事实。
- 低
- 身份、时效、价格、隐私或适用性存在重要缺口,只能作为待调查候选。
适用范围与条件
- 适用于rules-v2基于当前已审核模型与工具目录生成的编辑候选。
- 结果取决于提交的资料和目录快照,任一变化都可能改变结果。
- 它是低风险决策辅助,不证明质量、实时价格、基准领先、安全性、合法性或受监管用途适配。
每个结果必须展示的审计信息
集成后的推荐必须展示以下七项,让用户无需猜测证据边界。
- 推荐理由
- 证据
- 假设
- 最后审核
- 置信度
- 最佳替代项
- 何时不应选择
从真实任务到可复核结论
明确评测条件
比较前记录任务、成功标准、输入、限制、具体模型版本、设置和日期。
使用相同条件
所有候选使用相同任务和评分标准。隐藏模型名可减少名称偏差,但并非双盲或独立运行。
保留原始数据
保存提示词、回答、评分、错误、延迟和哈希;缺失数据不使用估算补齐。
说明结果边界
公开不确定性、样本量、排除项、利益关系,以及结果不能证明什么。
证据等级
Evidence v1/v2 检查文件格式和声明是否一致;“决策工作台”V3 还会根据已保存的输入重算哈希、分配、映射、评分和汇总,但不能证明L4 独立复现。
格式检查通过
文件符合声明的Schema,且没有明显的密钥字段。
记录完整
任务集、设置、模型信息和评测日期应完整一致;V1 目前只能检查其中一部分。
结果可重算
“决策工作台”V3 保存原始回答和评分输入,可在本地严格重算;Evidence v1/v2 不含同等字段。
独立复现
目标是由独立运行方或签名来源在可比条件下复现结果;V1 目前不能核验。
AI智能体榜单如何比较
每一行代表一个公开Agent配置在指定评测范围内的成绩,不能视为基础模型本身的分数。
比较系统配置
保留来源公开的Agent、基础模型、运行框架、工具、环境、预算和日期;未公开的字段保持未知。
保留原始量尺
只在相同基准、版本、任务规则和可比运行组内排名,不生成跨基准的万能总分。
标明数据状态
区分基准官方榜单记录、上游核查提交、服务商报告和社区运行。
保留运营数据
来源提供可比数据时展示成本、延迟、步骤数与人工介入;缺失值继续保持未知。
本地核验能确认什么
- ✓必填字段与支持的数据类型
- ✓评分、运行记录、日期与哈希的内部一致性
- ✓文件是否声明为演示数据
- ✓没有常见API密钥和敏感字段
单靠本地核验不能确认什么
- —声明的服务商或模型是否真的生成了输出
- —评分是否没有选择偏差或薄弱测试设计
- —一次结果是否适用于所有任务、语言、用户与未来版本
- —模型是否适合高风险、安全或法律相关决策
公开原则
不出售排名
赞助可以披露,但不能改变评分、证据门槛或展示位置。
比较版本,而非品牌
模型系列会持续变化,评测时必须记录准确的模型ID、设置、地区和日期。
先测真实任务,再做广泛结论
OpenGPT先按需求缩小候选,再让用户用自己的代表性任务验证。
不确定也是结果
平局、小样本、失败运行与无法下结论的证据都应该保留。