- 順位 1Claude Fable 5.1 Max EffortAnthropic83.41
- 順位 2Claude Fable 5 Max EffortAnthropic82.97
- 順位 3GPT-6 Astra Max EffortOpenAI82.16
公開評価データOpenGPT 外部の公開情報源:2件LiveBench · この版のデータ基準日
OpenGPTは公開済みの第三者評価データを整理して表示しており、モデルのテストを再実行していません。ランキングはモデル間の相対的な傾向を把握するためのものです。実際の選択では、ご自身の具体的なタスクで確認してください。
ランキング指標を選択
目的からランキングを選ぶ. 用途ごとに最も関連する公開指標を表示します。情報源と元の評価尺度も確認できます。
別名や実行設定を含む公開元の全記録を、情報源モデルIDまたは情報源名とともに表示します。公開元の順位を保持するため、同順位の後で番号が飛ぶ場合があります。
客観課題スコア. 7分野・23課題を客観採点するLiveBenchの総合スコアです。
10件中10件を表示. 客観課題スコア.
- 順位 1
Claude Fable 5.1 Max Effort
Anthropic客観課題スコア83.41 - 順位 2
Claude Fable 5 Max Effort
Anthropic客観課題スコア82.97 - 順位 3
GPT-6 Astra Max Effort
OpenAI客観課題スコア82.16 - 順位 4客観課題スコア81.59
- 順位 5
GPT-5.6 Sol Max Effort
OpenAI客観課題スコア81.05 - 順位 6客観課題スコア80.19
- 順位 7
Claude 5 Opus Thinking Max Effort
Anthropic客観課題スコア80.08 - 順位 8
Kimi K3
Moonshot AI客観課題スコア79.19 - 順位 9
Gemini 3.7 Flash High
Google客観課題スコア78.83 - 順位 10
Qwen 3.8 Max
Alibaba客観課題スコア78.46
ランキング方法各表示は元の指標、リリース、方法を維持します。リンクから根拠を確認できます。
ランキング根拠
公開元の全ランキングと公式モデルID
メインランキングには公開元の全記録を残し、情報源モデルIDまたは情報源名を表示します。どの行も比較でき、設定を保持できる正確な対応は公式版、それ以外は同じ情報源の記録として扱います。欠損値を0点にはしません。- 公式モデルID 79件
- 79
- 公開ランキングデータあり 0件
- 0
- 比較可能なデータ待ち 79件
- 79
- LiveBench · 監査用の情報源レコード 56件
- 56
ランキング根拠
本リサーチ版の読み方
スコアは各公開元の元尺度を維持し、1つの総合点には統合しません。
欠損値は0ではありません。このスナップショットで公開元が報告していないことを示します。
情報源にモデル設定が記載されている場合、順位はその設定と情報源リリースに対応し、すべての仕事・地域・導入形態には一般化できません。
掲載順位の購入はできません。使用した根拠へ直接リンクします。
ランキング根拠
データと情報源
各表示は元の指標、リリース、方法を維持します。リンクから根拠を確認できます。手法バージョン
予測可能な公開サイクル
有効なモデル情報源を6時間ごとに確認します。LMArenaとLiveBenchは、バージョン管理された検証ポリシーを通過した場合のみ自動公開します。一時停止中の情報源は履歴として保存し、現在のランキングには使用しません。- 01
6時間ごとの情報源確認
LMArenaとLiveBenchは、スキーマ、完全性、日付、整合性、異常値の確認を通過した更新だけを自動公開します。一時停止中の情報源は履歴のままです。
- 02
週次の変更要約
重要な順位、モデル、情報源の変更を、確認しやすい一つの更新にまとめます。
- 03
月次の履歴スナップショット
具体設定、情報源リリース、訂正を含む日付付きスナップショットを確定します。