OpenGPT RESEARCH

AI模型与Agent数据索引

从上游数据源或服务商出发,进入准确的模型、Agent产品或评测记录。每个页面都说明数据能证明什么,以及不能证明什么。

公开榜单来源
2
模型服务商
11
模型系列
13
Agent类别 · Agent评测
7 · 9

数据范围

本页是现有公开数据与服务商官方身份的索引。收录不代表OpenGPT背书,也不代表全局排名。

OpenGPT如何处理这些数据

本索引直接来自页面所使用的已核验模型目录、公开榜单快照、官方Agent身份目录与评测记录。

可比边界

  • 不同来源测量对象不同,不能合并成一个全局总分。
  • 采取行动前必须检查日期、版本与配置身份。
  • OpenGPT整理公开数据,不宣称重新运行了所有列出的评测。

浏览数据主题页

从统一研究索引查看OpenGPT的公开榜单来源、已核验服务商、模型系列、Agent类别和评测范围。

  1. LMArena公开榜单来源Text Style Control
  2. LiveBench公开榜单来源LiveBench-2026-06-25
  3. OpenAI模型服务商7 官方模型ID
  4. Anthropic模型服务商6 官方模型ID
  5. Google模型服务商12 官方模型ID
  6. Meta模型服务商5 官方模型ID
  7. DeepSeek模型服务商2 官方模型ID
  8. Alibaba Qwen模型服务商12 官方模型ID
  9. Mistral AI模型服务商6 官方模型ID
  10. xAI模型服务商5 官方模型ID
  11. Cohere模型服务商8 官方模型ID
  12. Microsoft模型服务商5 官方模型ID
  13. Moonshot AI模型服务商11 官方模型ID
  14. GPT模型系列7 官方模型ID
  15. CLAUDE模型系列6 官方模型ID
  16. GEMINI模型系列7 官方模型ID
  17. LLAMA模型系列3 官方模型ID
  18. MUSE模型系列2 官方模型ID
  19. DEEPSEEK模型系列2 官方模型ID
  20. QWEN模型系列12 官方模型ID
  21. MISTRAL模型系列6 官方模型ID
  22. GROK模型系列5 官方模型ID
  23. Command模型系列8 官方模型ID
  24. GEMMA模型系列5 官方模型ID
  25. PHI模型系列5 官方模型ID
  26. KIMI模型系列11 官方模型ID
  27. 编程Agent类别21 已核验产品
  28. 终端与运维Agent类别7 已核验产品
  29. 浏览器Agent类别7 已核验产品
  30. 电脑操作Agent类别6 已核验产品
  31. 工具与APIAgent类别7 已核验产品
  32. 研究Agent类别9 已核验产品
  33. 业务流程Agent类别9 已核验产品
  34. SWE-bench VerifiedAgent评测Verified · Top 10 published configurations · 500 tasks
  35. Terminal-Bench 2.1Agent评测terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  36. AssistantBenchAgent评测HAL verified snapshot · 33 public tasks · 1 scaffold
  37. WebArenaAgent评测v0.2.0 · canonical self-hosted environment
  38. OSWorld 2.0Agent评测task version v2026.06.24 · 500-step budget
  39. Berkeley Function-Calling LeaderboardAgent评测BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  40. GAIAAgent评测HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  41. τ²-bench CoreAgent评测v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  42. τ³-Banking KnowledgeAgent评测v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials