公開ランキング情報源

LiveBench AIモデルランキングデータ

OpenGPTはLiveBenchの公開レコード22件を元の範囲のまま保持します。再評価や他のベンチマークとの合成は行いません。

公開レコード
22
ランキング表示
客観課題 · スコア当たり費用 · オープンウェイト
情報源データ日
取得日

根拠の範囲

LiveBench-2026-06-25. Twenty-three objective tasks across seven categories; questions refresh every six months.

OpenGPTでの根拠の扱い

公開元の名称、順位、構成、日付、値を同じ範囲で保持します。欠損値を0にせず、情報源を横断する総合点も作りません。

比較できる範囲

  • 順位と値は指定された情報源の版と範囲内だけで比較できます。
  • 公式モデルIDへのリンクは対応根拠を確認した場合に限ります。
  • 公開順位は候補選定の指標であり、実務では正確な版を別途検証する必要があります。

LiveBench-2026-06-25

公開22件のうち代表14件を表示します。各行から元のIDと対応根拠を確認できます。

  1. Claude Fable 5Anthropic · 客観課題#183.0Max effort
  2. GPT-5.6 SolOpenAI · 客観課題#281.1Max effort
  3. GPT-5.5OpenAI · 客観課題#380.2xHigh effort
  4. Claude Opus 5Anthropic · 客観課題#480.1Max effort
  5. Kimi K3Moonshot AI · 客観課題#579.2Published benchmark configuration
  6. Qwen 3.8Alibaba · 客観課題#678.5Max effort
  7. DeepSeek V4 FlashDeepSeek · スコア当たり費用#1$0.0161Published benchmark configuration
  8. Grok Build 0.1xAI · スコア当たり費用#2$0.0240Published benchmark configuration
  9. DeepSeek V4 ProDeepSeek · スコア当たり費用#3$0.0498Published benchmark configuration
  10. DeepSeek V4 Flash 0731DeepSeek · スコア当たり費用#4$0.0596Published benchmark configuration
  11. MiniMax M3MiniMax · スコア当たり費用#5$0.0597Published benchmark configuration
  12. Grok 4.3xAI · スコア当たり費用#6$0.0614Published benchmark configuration
  13. Kimi K3Moonshot AI · オープンウェイト#179.2Open weights
  14. DeepSeek V4 Flash 0731DeepSeek · オープンウェイト#274.2Open weights