OpenGPT RESEARCH
AIモデル・エージェント根拠インデックス
上流の情報源や提供元から、正確なモデル、エージェント製品、評価レコードへ移動できます。各ページは根拠の対象と限界を明示します。
- 公開ランキング情報源
- 3
- モデル提供元
- 11
- モデル系列
- 13
- エージェント分類 · エージェント評価
- 7 · 9
根拠の範囲
既存の公開根拠と提供元が文書化したIDの索引です。掲載は推奨や普遍的な順位を意味しません。
OpenGPTでの根拠の扱い
表示ランキングと同じモデル一覧、公開スナップショット、一次情報のエージェント一覧、評価レコードから生成します。
比較できる範囲
- 異なる情報源は測定対象が違い、一つの総合点にできません。
- 判断前に日付、版、構成IDを確認してください。
- OpenGPTは公開根拠を整理し、すべての評価を再実行したとは主張しません。
根拠ハブを見る
公開ランキング情報源、確認済み提供元、モデル系列、エージェント分類、評価範囲を一つの研究インデックスから確認します。
- LMArena公開ランキング情報源Text Style Control
- Artificial Analysis公開ランキング情報源Intelligence Index v4.1.1
- LiveBench公開ランキング情報源LiveBench-2026-06-25
- OpenAIモデル提供元7 公式モデルID
- Anthropicモデル提供元6 公式モデルID
- Googleモデル提供元12 公式モデルID
- Metaモデル提供元5 公式モデルID
- DeepSeekモデル提供元2 公式モデルID
- Alibaba Qwenモデル提供元12 公式モデルID
- Mistral AIモデル提供元6 公式モデルID
- xAIモデル提供元5 公式モデルID
- Cohereモデル提供元8 公式モデルID
- Microsoftモデル提供元5 公式モデルID
- Moonshot AIモデル提供元11 公式モデルID
- GPTモデル系列7 公式モデルID
- CLAUDEモデル系列6 公式モデルID
- GEMINIモデル系列7 公式モデルID
- LLAMAモデル系列3 公式モデルID
- MUSEモデル系列2 公式モデルID
- DEEPSEEKモデル系列2 公式モデルID
- QWENモデル系列12 公式モデルID
- MISTRALモデル系列6 公式モデルID
- GROKモデル系列5 公式モデルID
- Commandモデル系列8 公式モデルID
- GEMMAモデル系列5 公式モデルID
- PHIモデル系列5 公式モデルID
- KIMIモデル系列11 公式モデルID
- コーディングエージェント分類21 確認済み製品
- ターミナル・DevOpsエージェント分類7 確認済み製品
- ブラウザエージェント分類7 確認済み製品
- PC操作エージェント分類6 確認済み製品
- ツール・APIエージェント分類7 確認済み製品
- 調査エージェント分類9 確認済み製品
- 業務フローエージェント分類9 確認済み製品
- SWE-bench Verifiedエージェント評価Verified · Top 10 published configurations · 500 tasks
- Terminal-Bench 2.1エージェント評価terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchエージェント評価HAL verified snapshot · 33 public tasks · 1 scaffold
- WebArenaエージェント評価v0.2.0 · canonical self-hosted environment
- OSWorld 2.0エージェント評価task version v2026.06.24 · 500-step budget
- Berkeley Function-Calling Leaderboardエージェント評価BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIAエージェント評価HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench Coreエージェント評価v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking Knowledgeエージェント評価v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials