OpenGPT RESEARCH
AI 模型与 Agent 数据索引
从上游数据源或服务商出发,进入准确的模型、Agent 产品或评测记录。每个页面都说明数据能证明什么,以及不能证明什么。
- 公开榜单来源
- 3
- 模型服务商
- 11
- 模型系列
- 13
- Agent 类别 · Agent 评测
- 7 · 9
数据范围
本页是现有公开数据与服务商官方身份的索引。收录不代表 OpenGPT 背书,也不代表全局排名。
OpenGPT 如何处理这些数据
本索引直接来自页面所使用的已核验模型目录、公开榜单快照、官方 Agent 身份目录与评测记录。
可比边界
- 不同来源测量对象不同,不能合并成一个全局总分。
- 采取行动前必须检查日期、版本与配置身份。
- OpenGPT 整理公开数据,不宣称重新运行了所有列出的评测。
浏览数据主题页
从统一研究索引查看 OpenGPT 的公开榜单来源、已核验服务商、模型系列、Agent 类别和评测范围。
- LMArena公开榜单来源Text Style Control
- Artificial Analysis公开榜单来源Intelligence Index v4.1.1
- LiveBench公开榜单来源LiveBench-2026-06-25
- OpenAI模型服务商7 官方模型 ID
- Anthropic模型服务商6 官方模型 ID
- Google模型服务商12 官方模型 ID
- Meta模型服务商5 官方模型 ID
- DeepSeek模型服务商2 官方模型 ID
- Alibaba Qwen模型服务商12 官方模型 ID
- Mistral AI模型服务商6 官方模型 ID
- xAI模型服务商5 官方模型 ID
- Cohere模型服务商8 官方模型 ID
- Microsoft模型服务商5 官方模型 ID
- Moonshot AI模型服务商11 官方模型 ID
- GPT模型系列7 官方模型 ID
- CLAUDE模型系列6 官方模型 ID
- GEMINI模型系列7 官方模型 ID
- LLAMA模型系列3 官方模型 ID
- MUSE模型系列2 官方模型 ID
- DEEPSEEK模型系列2 官方模型 ID
- QWEN模型系列12 官方模型 ID
- MISTRAL模型系列6 官方模型 ID
- GROK模型系列5 官方模型 ID
- Command模型系列8 官方模型 ID
- GEMMA模型系列5 官方模型 ID
- PHI模型系列5 官方模型 ID
- KIMI模型系列11 官方模型 ID
- 编程Agent 类别21 已核验产品
- 终端与运维Agent 类别7 已核验产品
- 浏览器Agent 类别7 已核验产品
- 电脑操作Agent 类别6 已核验产品
- 工具与 APIAgent 类别7 已核验产品
- 研究Agent 类别9 已核验产品
- 业务流程Agent 类别9 已核验产品
- SWE-bench VerifiedAgent 评测Verified · Top 10 published configurations · 500 tasks
- Terminal-Bench 2.1Agent 评测terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchAgent 评测HAL verified snapshot · 33 public tasks · 1 scaffold
- WebArenaAgent 评测v0.2.0 · canonical self-hosted environment
- OSWorld 2.0Agent 评测task version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardAgent 评测BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIAAgent 评测HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreAgent 评测v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeAgent 评测v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials