OpenGPT RESEARCH

AIモデル・エージェント根拠インデックス

上流の情報源や提供元から、正確なモデル、エージェント製品、評価レコードへ移動できます。各ページは根拠の対象と限界を明示します。

公開ランキング情報源
3
モデル提供元
11
モデル系列
13
エージェント分類 · エージェント評価
7 · 9

根拠の範囲

既存の公開根拠と提供元が文書化したIDの索引です。掲載は推奨や普遍的な順位を意味しません。

OpenGPTでの根拠の扱い

表示ランキングと同じモデル一覧、公開スナップショット、一次情報のエージェント一覧、評価レコードから生成します。

比較できる範囲

  • 異なる情報源は測定対象が違い、一つの総合点にできません。
  • 判断前に日付、版、構成IDを確認してください。
  • OpenGPTは公開根拠を整理し、すべての評価を再実行したとは主張しません。

根拠ハブを見る

公開ランキング情報源、確認済み提供元、モデル系列、エージェント分類、評価範囲を一つの研究インデックスから確認します。

  1. LMArena公開ランキング情報源Text Style Control
  2. Artificial Analysis公開ランキング情報源Intelligence Index v4.1.1
  3. LiveBench公開ランキング情報源LiveBench-2026-06-25
  4. OpenAIモデル提供元7 公式モデルID
  5. Anthropicモデル提供元6 公式モデルID
  6. Googleモデル提供元12 公式モデルID
  7. Metaモデル提供元5 公式モデルID
  8. DeepSeekモデル提供元2 公式モデルID
  9. Alibaba Qwenモデル提供元12 公式モデルID
  10. Mistral AIモデル提供元6 公式モデルID
  11. xAIモデル提供元5 公式モデルID
  12. Cohereモデル提供元8 公式モデルID
  13. Microsoftモデル提供元5 公式モデルID
  14. Moonshot AIモデル提供元11 公式モデルID
  15. GPTモデル系列7 公式モデルID
  16. CLAUDEモデル系列6 公式モデルID
  17. GEMINIモデル系列7 公式モデルID
  18. LLAMAモデル系列3 公式モデルID
  19. MUSEモデル系列2 公式モデルID
  20. DEEPSEEKモデル系列2 公式モデルID
  21. QWENモデル系列12 公式モデルID
  22. MISTRALモデル系列6 公式モデルID
  23. GROKモデル系列5 公式モデルID
  24. Commandモデル系列8 公式モデルID
  25. GEMMAモデル系列5 公式モデルID
  26. PHIモデル系列5 公式モデルID
  27. KIMIモデル系列11 公式モデルID
  28. コーディングエージェント分類21 確認済み製品
  29. ターミナル・DevOpsエージェント分類7 確認済み製品
  30. ブラウザエージェント分類7 確認済み製品
  31. PC操作エージェント分類6 確認済み製品
  32. ツール・APIエージェント分類7 確認済み製品
  33. 調査エージェント分類9 確認済み製品
  34. 業務フローエージェント分類9 確認済み製品
  35. SWE-bench Verifiedエージェント評価Verified · Top 10 published configurations · 500 tasks
  36. Terminal-Bench 2.1エージェント評価terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  37. AssistantBenchエージェント評価HAL verified snapshot · 33 public tasks · 1 scaffold
  38. WebArenaエージェント評価v0.2.0 · canonical self-hosted environment
  39. OSWorld 2.0エージェント評価task version v2026.06.24 · 500-step budget
  40. Berkeley Function-Calling Leaderboardエージェント評価BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  41. GAIAエージェント評価HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  42. τ²-bench Coreエージェント評価v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  43. τ³-Banking Knowledgeエージェント評価v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials