AI决策智能方法

公开一条推荐如何成为决策。

OpenGPT是AI Decision Intelligence Platform。我们将编辑需求匹配、事实来源、真实任务评测和公开基准证据分开,让每个结果都能说明条件与边界。

一分钟看懂方法

  • 名次只表示模型在某个来源和范围内的相对位置,不是万能总分。
  • 比较对象必须是具体模型版本或完整Agent配置。
  • 缺失或不可比的数据继续标为未知,不会变成 0 或强行合并排名。
  • 本地报告核验能确认结构与内部一致性,不能证明输出来源或服务商真实性。

编辑匹配分 · editorial-fit-v1

0–10编辑匹配分如何产生

八个目录信号用于逐维度比较。它们是独立记录的OpenGPT编辑判断层,与rules-v2推荐加分和公共基准证据分开。

编辑产品匹配分:10表示更符合所列维度;各维度同等展示,绝不合并成总冠军。

综合能力

0–10

根据公开能力、目录角色和已知产品限制,编辑判断其对广泛复杂工作的适用性;不是智商或基准分数。

编程

0–10

编辑判断其对软件规划、实现、调试、审核和代码库工作的适用性;不是实测通过率。

推理

0–10

编辑判断其对多步分析、约束处理和结构化解题的适用性;不是复现后的推理基准。

写作

0–10

编辑判断其对起草、编辑、长文与文档工作的适用性;不是文风或事实性的实测结果。

速度

0–10

根据产品定位和交付方式编辑判断其快速迭代适用性;不是实测延迟主张。

成本效率

0–10

根据标示档位和部署方式编辑判断其价格与运营成本可控性;不是总成本计算或价格保证。

隐私控制

0–10

根据本地、混合或云分类编辑判断其部署与数据控制适用性;不是安全、合规或遥测审计。

生态

0–10

编辑判断其对可用工具、集成、平台和部署选项的适用性;不是市场份额或集成质量实测。

权重与汇总

各维度的展示权重相同,但没有算术权重、平均分、总分或总冠军;用户根据声明条件决定哪些维度重要。

人工编辑判断边界

编辑依据rubric、服务商确认的产品事实和目录分类给出0–10整数。它不是具体版本实测、基准结果、概率或服务商保证。

来源

服务商官方页面支持身份、访问、公开能力、部署选项和标示价格;适用标签、优势、弱点、分类及全部0–10分均属OpenGPT编辑输入。

目录审核

目录最后审核:

置信度: 编辑覆盖完整度:中

置信度描述目录覆盖与解释的完整性,不表示表现良好的概率。服务商事实可能变化,匹配信号也没有经过独立实测。

适用范围

用于在当前产品与部署假设下,按具名维度比较目录记录;不要把分差当成实测性能差异。

采用前,请核实当前服务商事实,并测试具体模型版本、服务档位、工具、地区与代表性真实工作。

公开方法 · rules-v2

OpenGPT如何生成推荐

AI组合构建器把本地AI资料转成确定性候选清单。以下分数在预算和隐私硬门槛之后排列编辑产品匹配度,并不衡量模型质量。

评分维度与加分规则

分数是条件权重,不是百分比;硬门槛会在评分前排除不合格项目。

任务与目标匹配

模型 · 工具

模型每匹配一个所选任务加12分,精确匹配目标加10分;工具每匹配一个用途加10分。

用户声明条件 · OpenGPT编辑目录

隐私与部署

模型 · 工具

高隐私会排除非本地模型和非高隐私工具;合格本地模型加30分、高隐私工具加12分。中等隐私下,混合/本地/云模型分别加8/5/2分。

用户声明条件 · OpenGPT编辑目录

预算资格

模型 · 工具

超出所选标示价格范围的项目会被排除;合格模型加12分、工具加8分,免费档且标有免费入口的模型再加16分。

用户声明条件 · 服务商公开事实 · OpenGPT编辑目录

职业匹配

模型 · 工具

学生与模型匹配加10分,其他已支持的模型职业匹配加8分;学生与工具匹配加8分,其他工具职业匹配加6分。

用户声明条件 · OpenGPT编辑目录

行业信号

模型 · 工具

识别出的行业词会映射为任务类别;模型每项匹配加5分、工具加4分,自由文本本身不会复制进工作流。

用户声明条件 · OpenGPT编辑目录

语言匹配

模型

偏好非英语时,多语言目录匹配加14分,不匹配减3分;偏好英语时,写作或文档匹配加3分。

用户声明条件 · OpenGPT编辑目录

平台匹配

模型 · 工具

模型匹配权重为网页+3、桌面+10、终端+8、API+7、移动端+9;工具每个平台匹配加7分,无匹配减3分。

用户声明条件 · OpenGPT编辑目录

经验匹配

模型 · 工具

入门模型匹配加10分(本地模型不匹配减4分),高级匹配加7分,中级的前沿/混合模型匹配加2分;入门/高级工具匹配分别加6/5分。

用户声明条件 · OpenGPT编辑目录

选择与同分

模型 · 工具

合格候选按规则分排序,同分按名称排序;角色按固定顺序填充,剩余匹配模型最多取三个作为替代项。

确定性rules-v2

来源与主张边界

事实来源

服务商公开事实

官方页面用于支持身份、访问方式、公开能力描述和标示价格;OpenGPT不把它们当作独立性能测试。

编辑判断

OpenGPT编辑目录

适用标签、优势、隐私/部署分类和产品匹配信号属于经审核的编辑判断,不是基准实测或服务商保证。

用户声明条件

用户声明条件

目标、任务、职业、预算、隐私、语言、平台、经验和行业信号来自用户本地资料,属于适用条件,不是外部证据。

机械规则

确定性rules-v2

相同的标准化资料和目录快照会产生相同排序;计算可解释,但确定性不会把编辑输入变成事实。

仅供背景

公开基准背景

公开榜单是独立证据;rules-v2 不把基准名次或分数加入推荐分,应在筛选后按各来源范围查看。

事实与编辑判断

事实来源

事实主张必须能追溯到具名服务商或基准来源、可用时的精确身份和审核日期。

编辑判断

适用标签、优势、分类、假设、置信度和推荐属于OpenGPT编辑判断,不得包装成具体版本的实测结果。

审核周期与置信度

方法与有效推荐记录计划至少每90天审核一次,发生重大变化时也会触发审核。每个结果必须使用自身记录的审核日期,而不是本页日期。

以下情况触发审核

  • 服务商更改模型ID、生命周期、访问方式、能力说明或标示价格时。
  • 推荐引擎、权重、硬门槛或编辑分类发生变化时。
  • 更正发现重要来源、身份、价格、隐私或适用性错误时。

置信度规则

置信度描述匹配解释及其支撑记录的完整性,不表示模型表现良好的概率。

有精确身份和当前事实来源,重要字段已核实,假设已展示,并提供合格替代项。
匹配理由可解释,但采用前仍需确认至少一个来源、条件或当前事实。
身份、时效、价格、隐私或适用性存在重要缺口,只能作为待调查候选。

适用范围与条件

  • 适用于rules-v2基于当前已审核模型与工具目录生成的编辑候选。
  • 结果取决于提交的资料和目录快照,任一变化都可能改变结果。
  • 它是低风险决策辅助,不证明质量、实时价格、基准领先、安全性、合法性或受监管用途适配。

每个结果必须展示的审计信息

集成后的推荐必须展示以下七项,让用户无需猜测证据边界。

  1. 推荐理由
  2. 证据
  3. 假设
  4. 最后审核
  5. 置信度
  6. 最佳替代项
  7. 何时不应选择

从真实任务到可复核结论

1

明确评测条件

比较前记录任务、成功标准、输入、限制、具体模型版本、设置和日期。

2

使用相同条件

所有候选使用相同任务和评分标准。隐藏模型名可减少名称偏差,但并非双盲或独立运行。

3

保留原始数据

保存提示词、回答、评分、错误、延迟和哈希;缺失数据不使用估算补齐。

4

说明结果边界

公开不确定性、样本量、排除项、利益关系,以及结果不能证明什么。

证据等级

Evidence v1/v2 检查文件格式和声明是否一致;“决策工作台”V3 还会根据已保存的输入重算哈希、分配、映射、评分和汇总,但不能证明L4 独立复现。

L1现已支持

格式检查通过

文件符合声明的Schema,且没有明显的密钥字段。

L2部分支持

记录完整

任务集、设置、模型信息和评测日期应完整一致;V1 目前只能检查其中一部分。

L3V3 已支持

结果可重算

“决策工作台”V3 保存原始回答和评分输入,可在本地严格重算;Evidence v1/v2 不含同等字段。

L4尚未支持

独立复现

目标是由独立运行方或签名来源在可比条件下复现结果;V1 目前不能核验。

AI智能体榜单如何比较

每一行代表一个公开Agent配置在指定评测范围内的成绩,不能视为基础模型本身的分数。

比较系统配置

保留来源公开的Agent、基础模型、运行框架、工具、环境、预算和日期;未公开的字段保持未知。

保留原始量尺

只在相同基准、版本、任务规则和可比运行组内排名,不生成跨基准的万能总分。

标明数据状态

区分基准官方榜单记录、上游核查提交、服务商报告和社区运行。

保留运营数据

来源提供可比数据时展示成本、延迟、步骤数与人工介入;缺失值继续保持未知。

本地核验能确认什么

  • 必填字段与支持的数据类型
  • 评分、运行记录、日期与哈希的内部一致性
  • 文件是否声明为演示数据
  • 没有常见API密钥和敏感字段

单靠本地核验不能确认什么

  • 声明的服务商或模型是否真的生成了输出
  • 评分是否没有选择偏差或薄弱测试设计
  • 一次结果是否适用于所有任务、语言、用户与未来版本
  • 模型是否适合高风险、安全或法律相关决策

公开原则

不出售排名

赞助可以披露,但不能改变评分、证据门槛或展示位置。

比较版本,而非品牌

模型系列会持续变化,评测时必须记录准确的模型ID、设置、地区和日期。

先测真实任务,再做广泛结论

OpenGPT先按需求缩小候选,再让用户用自己的代表性任务验证。

不确定也是结果

平局、小样本、失败运行与无法下结论的证据都应该保留。