可信度与数据状态

哪些内容已检查、审核和发布

查看OpenGPT模型与Agent榜单背后的证据状态,包括来源数据日、最近检查和发布控制。

状态政策更新

01

模型榜单来源

实时监测状态来自公开状态接口;来源数据日与检查时间分开显示。

来源证据状态来源数据日最近检查发布控制
正在读取实时状态
验证通过后自动发布
Artificial Analysis打开来源
正在读取实时状态
来源未公布
人工审核后发布
正在读取实时状态
人工审核后发布

02

Agent评测来源

这里显示已发布证据及其最近一次记录的检查,不代表来源网站或产品在线。

来源证据状态来源数据日最近检查发布控制
SWE-bench Verified打开来源
历史快照
人工审核后发布
Terminal-Bench 2.1打开来源
已发布快照
人工审核后发布
AssistantBench打开来源
历史快照
来源未公布
人工审核后发布
来源需要复核
来源未公布
人工审核后发布
OSWorld 2.0打开来源
已发布快照
人工审核后发布
Berkeley Function-Calling Leaderboard打开来源
历史快照
人工审核后发布
历史快照
来源未公布
人工审核后发布
τ²-bench Core打开来源
已发布快照
来源未公布
人工审核后发布
τ³-Banking Knowledge打开来源
已发布快照
人工审核后发布

03

服务边界

每个状态只说明这里明确列出的流程,不能理解为更广泛的可用性承诺。

公开榜单

OpenGPT发布来源快照与目录记录,不持续检测服务商API、模型端点、价格或地区可用性。

来源监测

系统按标明的周期检查已配置的上游数据;一次检查成功不能证明每个来源页面、模型或API都可用。

本地决策工具

收藏、任务输入和报告默认保存在当前浏览器;本页状态不代表云端同步或数据恢复。

提交与邮件

提交会进入编辑审核。提交确认和最终结果邮件通过事务队列发送,不承诺即时送达或固定审核时间。

04

发布决定如何产生

采集、审核、目录收录、可比性和榜单排名始终是不同决定。

01

验证后自动发布

只有LMArena符合条件,而且必须通过结构、完整性、日期与异常检查;验证失败时不会发布。

02

人工来源审核

Artificial Analysis、LiveBench与Agent来源在改变公开证据前,都需要人工审核。

03

用户提交

审核通过可以让Agent产品进入公开目录,但不会设置排名、可比资格或证据等级,也不保证进入榜单。

05

方法与更正

查看比较规则,或报告错误的日期、身份映射、链接和证据标签。