公開ランキング情報源

LiveBench AIモデルランキングデータ

OpenGPTはLiveBenchの公開レコード30件を元の範囲のまま保持します。再評価や他のベンチマークとの合成は行いません。

公開レコード
30
ランキング表示
客観課題 · スコア当たり費用 · オープンウェイト
情報源データ日
取得日

根拠の範囲

23の客観タスクと7カテゴリにわたるLiveBench-2026-06-25. 51件の公開モデル構成。問題は6か月ごとに更新されます。

OpenGPTでの根拠の扱い

公開元の名称、順位、構成、日付、値を同じ範囲で保持します。欠損値を0にせず、情報源を横断する総合点も作りません。

比較できる範囲

  • 順位と値は指定された情報源の版と範囲内だけで比較できます。
  • 公式モデルIDへのリンクは対応根拠を確認した場合に限ります。
  • 公開順位は候補選定の指標であり、実務では正確な版を別途検証する必要があります。

LiveBench-2026-06-25

公開30件のうち代表18件を表示します。各行から元のIDと対応根拠を確認できます。

  1. Claude Fable 5.1 Max EffortAnthropic · 客観課題#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · 客観課題#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · 客観課題#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · 客観課題#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · 客観課題#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · 客観課題#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · スコア当たり費用#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · スコア当たり費用#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · スコア当たり費用#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · スコア当たり費用#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · スコア当たり費用#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · スコア当たり費用#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · オープンウェイト#179.19公開ウェイト
  14. Qwen 3.8 MaxAlibaba · オープンウェイト#278.46公開ウェイト
  15. DeepSeek V4 Pro 0813DeepSeek · オープンウェイト#377.44公開ウェイト
  16. DeepSeek V4 Flash Vision ExpDeepSeek · オープンウェイト#476.76公開ウェイト
  17. Qwen 3.8 Flash NextAlibaba · オープンウェイト#576.19公開ウェイト
  18. GLM-5.3Z.AI · オープンウェイト#676.14公開ウェイト