LiveBench AI Daten zum Modell-Ranking
OpenGPT bewahrt 30 veröffentlichte LiveBench-Datensätze in ihrem ursprünglichen Quellumfang. Dieses Ranking wird weder erneut ausgeführt noch mit einem anderen Benchmark vermischt.
- Veröffentlichte Datensätze
- 30
- Rankingansichten
- Objective tasks · Cost per score point · Open-weight models
- Datum der Quelldaten
- Abgerufen
Nachweisumfang
LiveBench-2026-06-25. 51 veröffentlichte Modellkonfigurationen für dreiundzwanzig objektive Aufgaben und sieben Kategorien; Aktualisierung der Fragen alle sechs Monate.
How OpenGPT handles this evidence
OpenGPT speichert Labels, Positionen, Konfigurationen, Daten und Werte des Herausgebers innerhalb desselben veröffentlichten Umfangs. Fehlende Werte werden weder in null umgewandelt noch wird diese Quelle mit anderen Quellen zu einer Punktzahl zusammengeführt.
Vergleichsgrenzen
- Ränge und Werte sind nur innerhalb der genannten Quellveröffentlichung und des genannten Rankingumfangs vergleichbar.
- Eine in der Quelle aufgeführte Konfiguration wird erst dann mit einem offiziellen Modell ID verknüpft, wenn der Identitätsnachweis geprüft wurde.
- Veröffentlichte Rankings sind Auswahlsignale; die Entscheidung für den Produktionseinsatz erfordert weiterhin einen Test der exakten Version anhand realer Arbeit.
LiveBench-2026-06-25
18 repräsentative Zeilen aus 30 veröffentlichten Datensätzen werden angezeigt. Öffnen Sie eine Zeile, um ihre exakte Quellidentität und Zuordnungsevidenz zu prüfen.
- Claude Fable 5.1 Max EffortAnthropic · Objective Aufgaben#183.41Published benchmark configuration
- Claude Fable 5 Max EffortAnthropic · Objective Aufgaben#282.97Published benchmark configuration
- GPT-6 Astra Max EffortOpenAI · Objective Aufgaben#382.16Published benchmark configuration
- Muse Spark 1.3 xHigh EffortMeta · Objective Aufgaben#481.59Published benchmark configuration
- GPT-5.6 Sol Max EffortOpenAI · Objective Aufgaben#581.05Published benchmark configuration
- GPT-5.5 Thinking xHigh EffortOpenAI · Objective Aufgaben#680.19Published benchmark configuration
- Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
- GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
- Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
- DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
- DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
- DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
- Kimi K3Moonshot AI · Open-weight models#179.19Offene Gewichte öffnen
- Qwen 3.8 MaxAlibaba · Open-weight models#278.46Offene Gewichte öffnen
- DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Offene Gewichte öffnen
- DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Offene Gewichte öffnen
- Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Offene Gewichte öffnen
- GLM-5.3Z.AI · Open-weight models#676.14Offene Gewichte öffnen