OpenGPT RESEARCH

AI 模型與 Agent 資料索引

從上游資料來源或服務商出發,進入準確的模型、Agent 產品或評測記錄。每個頁面都說明資料能證明什麼,以及不能證明什麼。

公開榜單來源
3
模型服務商
11
模型系列
13
Agent 類別 · Agent 評測
7 · 9

資料範圍

本頁是現有公開資料與服務商官方身分的索引。收錄不代表 OpenGPT 背書,也不代表全域排名。

OpenGPT 如何處理這些資料

本索引直接來自頁面所使用的已核驗模型目錄、公開榜單快照、官方 Agent 身分目錄與評測記錄。

可比範圍

  • 不同來源測量對象不同,不能合併成一個全域總分。
  • 採取行動前必須檢查日期、版本與設定身分。
  • OpenGPT 整理公開資料,不宣稱重新執行了所有列出的評測。

瀏覽資料主題頁

從統一研究索引查看 OpenGPT 的公開榜單來源、已核驗服務商、模型系列、Agent 類別和評測範圍。

  1. LMArena公開榜單來源Text Style Control
  2. Artificial Analysis公開榜單來源Intelligence Index v4.1.1
  3. LiveBench公開榜單來源LiveBench-2026-06-25
  4. OpenAI模型服務商7 官方模型 ID
  5. Anthropic模型服務商6 官方模型 ID
  6. Google模型服務商12 官方模型 ID
  7. Meta模型服務商5 官方模型 ID
  8. DeepSeek模型服務商2 官方模型 ID
  9. Alibaba Qwen模型服務商12 官方模型 ID
  10. Mistral AI模型服務商6 官方模型 ID
  11. xAI模型服務商5 官方模型 ID
  12. Cohere模型服務商8 官方模型 ID
  13. Microsoft模型服務商5 官方模型 ID
  14. Moonshot AI模型服務商11 官方模型 ID
  15. GPT模型系列7 官方模型 ID
  16. CLAUDE模型系列6 官方模型 ID
  17. GEMINI模型系列7 官方模型 ID
  18. LLAMA模型系列3 官方模型 ID
  19. MUSE模型系列2 官方模型 ID
  20. DEEPSEEK模型系列2 官方模型 ID
  21. QWEN模型系列12 官方模型 ID
  22. MISTRAL模型系列6 官方模型 ID
  23. GROK模型系列5 官方模型 ID
  24. Command模型系列8 官方模型 ID
  25. GEMMA模型系列5 官方模型 ID
  26. PHI模型系列5 官方模型 ID
  27. KIMI模型系列11 官方模型 ID
  28. 程式設計Agent 類別21 已核驗產品
  29. 終端與維運Agent 類別7 已核驗產品
  30. 瀏覽器Agent 類別7 已核驗產品
  31. 電腦操作Agent 類別6 已核驗產品
  32. 工具與 APIAgent 類別7 已核驗產品
  33. 研究Agent 類別9 已核驗產品
  34. 業務流程Agent 類別9 已核驗產品
  35. SWE-bench VerifiedAgent 評測Verified · Top 10 published configurations · 500 tasks
  36. Terminal-Bench 2.1Agent 評測terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  37. AssistantBenchAgent 評測HAL verified snapshot · 33 public tasks · 1 scaffold
  38. WebArenaAgent 評測v0.2.0 · canonical self-hosted environment
  39. OSWorld 2.0Agent 評測task version v2026.06.24 · 500-step budget
  40. Berkeley Function-Calling LeaderboardAgent 評測BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  41. GAIAAgent 評測HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  42. τ²-bench CoreAgent 評測v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  43. τ³-Banking KnowledgeAgent 評測v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials