OpenGPT RESEARCH

AI 模型与 Agent 数据索引

从上游数据源或服务商出发,进入准确的模型、Agent 产品或评测记录。每个页面都说明数据能证明什么,以及不能证明什么。

公开榜单来源
3
模型服务商
11
模型系列
13
Agent 类别 · Agent 评测
7 · 9

数据范围

本页是现有公开数据与服务商官方身份的索引。收录不代表 OpenGPT 背书,也不代表全局排名。

OpenGPT 如何处理这些数据

本索引直接来自页面所使用的已核验模型目录、公开榜单快照、官方 Agent 身份目录与评测记录。

可比边界

  • 不同来源测量对象不同,不能合并成一个全局总分。
  • 采取行动前必须检查日期、版本与配置身份。
  • OpenGPT 整理公开数据,不宣称重新运行了所有列出的评测。

浏览数据主题页

从统一研究索引查看 OpenGPT 的公开榜单来源、已核验服务商、模型系列、Agent 类别和评测范围。

  1. LMArena公开榜单来源Text Style Control
  2. Artificial Analysis公开榜单来源Intelligence Index v4.1.1
  3. LiveBench公开榜单来源LiveBench-2026-06-25
  4. OpenAI模型服务商7 官方模型 ID
  5. Anthropic模型服务商6 官方模型 ID
  6. Google模型服务商12 官方模型 ID
  7. Meta模型服务商5 官方模型 ID
  8. DeepSeek模型服务商2 官方模型 ID
  9. Alibaba Qwen模型服务商12 官方模型 ID
  10. Mistral AI模型服务商6 官方模型 ID
  11. xAI模型服务商5 官方模型 ID
  12. Cohere模型服务商8 官方模型 ID
  13. Microsoft模型服务商5 官方模型 ID
  14. Moonshot AI模型服务商11 官方模型 ID
  15. GPT模型系列7 官方模型 ID
  16. CLAUDE模型系列6 官方模型 ID
  17. GEMINI模型系列7 官方模型 ID
  18. LLAMA模型系列3 官方模型 ID
  19. MUSE模型系列2 官方模型 ID
  20. DEEPSEEK模型系列2 官方模型 ID
  21. QWEN模型系列12 官方模型 ID
  22. MISTRAL模型系列6 官方模型 ID
  23. GROK模型系列5 官方模型 ID
  24. Command模型系列8 官方模型 ID
  25. GEMMA模型系列5 官方模型 ID
  26. PHI模型系列5 官方模型 ID
  27. KIMI模型系列11 官方模型 ID
  28. 编程Agent 类别21 已核验产品
  29. 终端与运维Agent 类别7 已核验产品
  30. 浏览器Agent 类别7 已核验产品
  31. 电脑操作Agent 类别6 已核验产品
  32. 工具与 APIAgent 类别7 已核验产品
  33. 研究Agent 类别9 已核验产品
  34. 业务流程Agent 类别9 已核验产品
  35. SWE-bench VerifiedAgent 评测Verified · Top 10 published configurations · 500 tasks
  36. Terminal-Bench 2.1Agent 评测terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  37. AssistantBenchAgent 评测HAL verified snapshot · 33 public tasks · 1 scaffold
  38. WebArenaAgent 评测v0.2.0 · canonical self-hosted environment
  39. OSWorld 2.0Agent 评测task version v2026.06.24 · 500-step budget
  40. Berkeley Function-Calling LeaderboardAgent 评测BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  41. GAIAAgent 评测HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  42. τ²-bench CoreAgent 评测v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  43. τ³-Banking KnowledgeAgent 评测v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials