OpenGPT RESEARCH
AI 模型與 Agent 資料索引
從上游資料來源或服務商出發,進入準確的模型、Agent 產品或評測記錄。每個頁面都說明資料能證明什麼,以及不能證明什麼。
- 公開榜單來源
- 3
- 模型服務商
- 11
- 模型系列
- 13
- Agent 類別 · Agent 評測
- 7 · 9
資料範圍
本頁是現有公開資料與服務商官方身分的索引。收錄不代表 OpenGPT 背書,也不代表全域排名。
OpenGPT 如何處理這些資料
本索引直接來自頁面所使用的已核驗模型目錄、公開榜單快照、官方 Agent 身分目錄與評測記錄。
可比範圍
- 不同來源測量對象不同,不能合併成一個全域總分。
- 採取行動前必須檢查日期、版本與設定身分。
- OpenGPT 整理公開資料,不宣稱重新執行了所有列出的評測。
瀏覽資料主題頁
從統一研究索引查看 OpenGPT 的公開榜單來源、已核驗服務商、模型系列、Agent 類別和評測範圍。
- LMArena公開榜單來源Text Style Control
- Artificial Analysis公開榜單來源Intelligence Index v4.1.1
- LiveBench公開榜單來源LiveBench-2026-06-25
- OpenAI模型服務商7 官方模型 ID
- Anthropic模型服務商6 官方模型 ID
- Google模型服務商12 官方模型 ID
- Meta模型服務商5 官方模型 ID
- DeepSeek模型服務商2 官方模型 ID
- Alibaba Qwen模型服務商12 官方模型 ID
- Mistral AI模型服務商6 官方模型 ID
- xAI模型服務商5 官方模型 ID
- Cohere模型服務商8 官方模型 ID
- Microsoft模型服務商5 官方模型 ID
- Moonshot AI模型服務商11 官方模型 ID
- GPT模型系列7 官方模型 ID
- CLAUDE模型系列6 官方模型 ID
- GEMINI模型系列7 官方模型 ID
- LLAMA模型系列3 官方模型 ID
- MUSE模型系列2 官方模型 ID
- DEEPSEEK模型系列2 官方模型 ID
- QWEN模型系列12 官方模型 ID
- MISTRAL模型系列6 官方模型 ID
- GROK模型系列5 官方模型 ID
- Command模型系列8 官方模型 ID
- GEMMA模型系列5 官方模型 ID
- PHI模型系列5 官方模型 ID
- KIMI模型系列11 官方模型 ID
- 程式設計Agent 類別21 已核驗產品
- 終端與維運Agent 類別7 已核驗產品
- 瀏覽器Agent 類別7 已核驗產品
- 電腦操作Agent 類別6 已核驗產品
- 工具與 APIAgent 類別7 已核驗產品
- 研究Agent 類別9 已核驗產品
- 業務流程Agent 類別9 已核驗產品
- SWE-bench VerifiedAgent 評測Verified · Top 10 published configurations · 500 tasks
- Terminal-Bench 2.1Agent 評測terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchAgent 評測HAL verified snapshot · 33 public tasks · 1 scaffold
- WebArenaAgent 評測v0.2.0 · canonical self-hosted environment
- OSWorld 2.0Agent 評測task version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardAgent 評測BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIAAgent 評測HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreAgent 評測v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeAgent 評測v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials