OpenGPT RESEARCH
AI模型與Agent資料索引
從上游資料來源或服務商出發,進入準確的模型、Agent產品或評測記錄。每個頁面都說明資料能證明什麼,以及不能證明什麼。
- 公開榜單來源
- 2
- 模型服務商
- 11
- 模型系列
- 13
- Agent類別 · Agent評測
- 7 · 9
資料範圍
本頁是現有公開資料與服務商官方身分的索引。收錄不代表OpenGPT背書,也不代表全域排名。
OpenGPT如何處理這些資料
本索引直接來自頁面所使用的已核驗模型目錄、公開榜單快照、官方Agent身分目錄與評測記錄。
可比範圍
- 不同來源測量對象不同,不能合併成一個全域總分。
- 採取行動前必須檢查日期、版本與設定身分。
- OpenGPT整理公開資料,不宣稱重新執行了所有列出的評測。
瀏覽資料主題頁
從統一研究索引查看OpenGPT的公開榜單來源、已核驗服務商、模型系列、Agent類別和評測範圍。
- LMArena公開榜單來源Text Style Control
- LiveBench公開榜單來源LiveBench-2026-06-25
- OpenAI模型服務商7 官方模型ID
- Anthropic模型服務商6 官方模型ID
- Google模型服務商12 官方模型ID
- Meta模型服務商5 官方模型ID
- DeepSeek模型服務商2 官方模型ID
- Alibaba Qwen模型服務商12 官方模型ID
- Mistral AI模型服務商6 官方模型ID
- xAI模型服務商5 官方模型ID
- Cohere模型服務商8 官方模型ID
- Microsoft模型服務商5 官方模型ID
- Moonshot AI模型服務商11 官方模型ID
- GPT模型系列7 官方模型ID
- CLAUDE模型系列6 官方模型ID
- GEMINI模型系列7 官方模型ID
- LLAMA模型系列3 官方模型ID
- MUSE模型系列2 官方模型ID
- DEEPSEEK模型系列2 官方模型ID
- QWEN模型系列12 官方模型ID
- MISTRAL模型系列6 官方模型ID
- GROK模型系列5 官方模型ID
- Command模型系列8 官方模型ID
- GEMMA模型系列5 官方模型ID
- PHI模型系列5 官方模型ID
- KIMI模型系列11 官方模型ID
- 程式設計Agent類別21 已核驗產品
- 終端與維運Agent類別7 已核驗產品
- 瀏覽器Agent類別7 已核驗產品
- 電腦操作Agent類別6 已核驗產品
- 工具與APIAgent類別7 已核驗產品
- 研究Agent類別9 已核驗產品
- 業務流程Agent類別9 已核驗產品
- SWE-bench VerifiedAgent評測Verified · Top 10 published configurations · 500 tasks
- Terminal-Bench 2.1Agent評測terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchAgent評測HAL verified snapshot · 33 public tasks · 1 scaffold
- WebArenaAgent評測v0.2.0 · canonical self-hosted environment
- OSWorld 2.0Agent評測task version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardAgent評測BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIAAgent評測HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreAgent評測v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeAgent評測v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials