Unabhängige Modellentscheidungen

KI-Modellrankings

Exakte Modellversionen anhand öffentlicher Evidenz in die engere Auswahl nehmen, sie auf einheitlicher Grundlage vergleichen und die Wahl anschließend mit Ihrer eigenen Aufgabe überprüfen.

Objektive AufgabenLiveBench · 3 von 10 angezeigt
  1. Rang 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. Rang 2Claude Fable 5 Max EffortAnthropic82.97
  3. Rang 3GPT-6 Astra Max EffortOpenAI82.16
Daten aus veröffentlichten Bewertungen2 externe öffentliche QuellenLiveBench · Datenstand dieser Ausgabe

OpenGPT ordnet und präsentiert öffentlich veröffentlichte Bewertungsdaten Dritter; die Modelle wurden nicht erneut getestet. Nutzen Sie das Ranking, um die relative Leistung einzuordnen, und prüfen Sie Kandidaten anschließend mit Ihren eigenen Aufgaben.

Datenausgabe
2026-09Veröffentlicht ·
Umfang automatisierter Entscheidungen
20 in automatischer Überprüfung / 79-KatalogmodelleDatenstichtag · 2026-08-30
Aktueller Ranking-Snapshot · LiveBench
2026-09-07 · 56 Quelldatensätze
Neueste vergleichbare Änderungsausgabe · LiveBench
Unbekannt
Lebenszyklusabdeckung
36 Dokumentierte Lebenszyklusstatus / 79 · 20 im AutomatisierungsumfangDatenstichtag · 2026-08-30

Ranking-Perspektive wählen

Mit der anstehenden Entscheidung beginnen. Jedes Szenario öffnet das relevanteste veröffentlichte Rankingsignal. Originalquelle und Skala bleiben sichtbar.

Anzeigeumfang wählen

Zeigt alle veröffentlichten Einträge mit Quellen-Modell-ID oder Quellenname einschließlich Aliasnamen und Konfigurationen. Die Quellenränge bleiben erhalten.

Objektive Aufgaben. LiveBench-Gesamtbewertung über 23 objektiv bewertete Aufgaben in sieben Kategorien.

10 von 10 angezeigt. Objektive Aufgaben.

  1. Rang 1
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    claude-fable-5-1-max-effort
    Objektive Aufgaben
    83.41
    Originalquelle
  2. Rang 2
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    claude-fable-5-max-effort
    Objektive Aufgaben
    82.97
    Originalquelle
  3. Rang 3
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    gpt-6-astra-max
    Objektive Aufgaben
    82.16
    Originalquelle
  4. Rang 4
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    muse-spark-1.3-xhigh
    Objektive Aufgaben
    81.59
    Originalquelle
  5. Rang 5
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    gpt-5.6-sol-max
    Objektive Aufgaben
    81.05
    Originalquelle
  6. Rang 6
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    gpt-5.5-xhigh
    Objektive Aufgaben
    80.19
    Originalquelle
  7. Rang 7
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    claude-opus-5-max-effort
    Objektive Aufgaben
    80.08
    Originalquelle
  8. Rang 8

    Kimi K3

    Moonshot AI
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    kimi-k3
    Objektive Aufgaben
    79.19
    Originalquelle
  9. Rang 9
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    gemini-3.7-flash-high
    Objektive Aufgaben
    78.83
    Originalquelle
  10. Rang 10
    Modelleinstellungen
    Published benchmark configuration
    Quellmodell-ID
    qwen3.8-max
    Objektive Aufgaben
    78.46
    Originalquelle
Unabhängige QuelleLiveBench10 veröffentlichte Einträge · Erfasst am: 9. Sept. 2026
LiveBench

ÜberwachungsstatusLive-Status nicht verfügbarValidierte automatische Veröffentlichung

Datum der Quelldaten
Von OpenGPT abgerufen
Letzte Ranking-Änderung

LMArena + LiveBench: validierte automatische Veröffentlichung · Pausierte Quellen: nur historisch

Ranking-MethodeJede Ansicht bewahrt Metrik, Veröffentlichung und Methodik der Quelle. Über die Links können Sie die zugrunde liegende Arbeit prüfen.

Ranking-Grundlage

Vollständige veröffentlichte Rangliste und offizielle Modell-IDs

Die Hauptrangliste bewahrt jeden Herausgeberdatensatz und zeigt dessen Quellen-Modell-ID oder Quellenname an. Jede Zeile kann verglichen werden: Exakte, konfigurationssichere Zuordnungen verwenden offizielle Versionen; alle anderen Zeilen verbleiben innerhalb einer Quellenrangliste. Fehlende Daten werden nie zu einem Wert von null.
79 offizielle Modell-IDs
79
0 mit öffentlichem Ranking Daten
0
79 Wartet auf vergleichbare Daten.
79
LiveBench · 56 für Audits aufbewahrte Quelldatensätze
56
Modellverzeichnis

Ranking-Grundlage

So lesen Sie diese Forschungsausgabe

  • Bewertungen bleiben auf den ursprünglichen Skalen der Herausgeber. Sie werden nicht zu einer Gesamtbewertung zusammengeführt.

  • Fehlende Daten bedeuten nicht null. Sie bedeuten, dass der Herausgeber diese Kennzahl für diesen Snapshot nicht angegeben hat.

  • Wenn eine Quelle Modelleinstellungen meldet, gilt die Platzierung für genau diese Konfiguration und Quellversion – nicht für jede Aufgabe, Region oder Bereitstellung.

  • Kein Anbieter kann für eine Platzierung bezahlen. OpenGPT verlinkt direkt auf die verwendeten Belege.

Ranking-Grundlage

Daten und Quellen

Jede Ansicht bewahrt Metrik, Veröffentlichung und Methodik der Quelle. Über die Links können Sie die zugrunde liegende Arbeit prüfen.
AR

LMArena

Die vollständige aktuelle Gesamtrangliste mit Stilkontrolle, basierend auf Nutzern, die zwei Modellantworten direkt miteinander vergleichen.

Veröffentlichungsdatum der Rangliste
2. Sept. 2026
Erfasst am
9. Sept. 2026
Lizenz
CC BY 4.0

OriginalranglisteMethodik

LB

LiveBench

Dreiundzwanzig objektive Aufgaben in sieben Kategorien; die Fragen werden alle sechs Monate aktualisiert.

Datenversion
LiveBench-2026-06-25
Erfasst am
9. Sept. 2026
Lizenz
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

OriginalranglisteMethodik

Methodenversion

Ein verlässlicher Veröffentlichungsrhythmus

OpenGPT prüft aktive Modellquellen alle sechs Stunden. LMArena und LiveBench werden erst veröffentlicht, nachdem ihre versionierten Validierungsregeln erfüllt sind. Pausierte Quellen bleiben historisch und fließen nicht in aktuelle Rankings ein.
  1. 01

    Quellenprüfung alle 6 Std.

    Aktualisierungen von LMArena und LiveBench werden erst nach Prüfungen auf Schema, Vollständigkeit, Datum, Integrität und Anomalien automatisch veröffentlicht. Pausierte Quellen bleiben historisch.

  2. 02

    Wöchentliche Änderungsübersicht

    Fasst wichtige Änderungen bei Rang, Modellen und Quellen in einem prüfbaren Update zusammen.

  3. 03

    Monatlicher Verlaufssnapshot

    Friert einen datierten Snapshot mit exakten Konfigurationen, Quellenständen und Korrekturen ein.