Quellen öffentlicher Rankings

LiveBench AI Daten zum Modell-Ranking

OpenGPT bewahrt 30 veröffentlichte LiveBench-Datensätze in ihrem ursprünglichen Quellumfang. Dieses Ranking wird weder erneut ausgeführt noch mit einem anderen Benchmark vermischt.

Veröffentlichte Datensätze
30
Rankingansichten
Objective tasks · Cost per score point · Open-weight models
Datum der Quelldaten
Abgerufen

Nachweisumfang

LiveBench-2026-06-25. 51 veröffentlichte Modellkonfigurationen für dreiundzwanzig objektive Aufgaben und sieben Kategorien; Aktualisierung der Fragen alle sechs Monate.

How OpenGPT handles this evidence

OpenGPT speichert Labels, Positionen, Konfigurationen, Daten und Werte des Herausgebers innerhalb desselben veröffentlichten Umfangs. Fehlende Werte werden weder in null umgewandelt noch wird diese Quelle mit anderen Quellen zu einer Punktzahl zusammengeführt.

Vergleichsgrenzen

  • Ränge und Werte sind nur innerhalb der genannten Quellveröffentlichung und des genannten Rankingumfangs vergleichbar.
  • Eine in der Quelle aufgeführte Konfiguration wird erst dann mit einem offiziellen Modell ID verknüpft, wenn der Identitätsnachweis geprüft wurde.
  • Veröffentlichte Rankings sind Auswahlsignale; die Entscheidung für den Produktionseinsatz erfordert weiterhin einen Test der exakten Version anhand realer Arbeit.

LiveBench-2026-06-25

18 repräsentative Zeilen aus 30 veröffentlichten Datensätzen werden angezeigt. Öffnen Sie eine Zeile, um ihre exakte Quellidentität und Zuordnungsevidenz zu prüfen.

  1. Claude Fable 5.1 Max EffortAnthropic · Objective Aufgaben#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · Objective Aufgaben#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · Objective Aufgaben#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · Objective Aufgaben#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · Objective Aufgaben#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · Objective Aufgaben#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · Open-weight models#179.19Offene Gewichte öffnen
  14. Qwen 3.8 MaxAlibaba · Open-weight models#278.46Offene Gewichte öffnen
  15. DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Offene Gewichte öffnen
  16. DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Offene Gewichte öffnen
  17. Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Offene Gewichte öffnen
  18. GLM-5.3Z.AI · Open-weight models#676.14Offene Gewichte öffnen