Fonti delle classifiche pubbliche
Dati di classifica dei modelli di AI di LiveBench
OpenGPT conserva 30 record LiveBench pubblicati nel relativo ambito di origine. Non ripete né combina questa classifica con un altro benchmark.
- Record pubblicati
- 30
- Viste della classifica
- Objective tasks · Cost per score point · Open-weight models
- Data dei dati della fonte
- Recuperato
Ambito delle evidenze
LiveBench-2026-06-25. 51 configurazioni di modelli pubblicate per ventitré attività oggettive e sette categorie; le domande vengono aggiornate ogni sei mesi.
How OpenGPT handles this evidence
OpenGPT memorizza etichette, posizioni, configurazioni, date e valori del publisher nello stesso ambito pubblicato. Non converte i valori mancanti in zero né aggrega questa fonte in un punteggio tra fonti diverse.
Limiti del confronto
- Posizioni e valori sono comparabili soltanto all’interno della versione della fonte e dell’ambito di classifica indicati.
- Una configurazione elencata dalla fonte viene collegata a un ID ufficiale del modello solo dopo la verifica delle evidenze sull’identità.
- Le classifiche pubblicate sono segnali per una selezione preliminare; la scelta per la produzione richiede comunque di provare la versione esatta sul lavoro reale.
LiveBench-2026-06-25
Visualizzate 18 righe rappresentative ricavate da 30 registri pubblicati. Apri una riga per esaminarne l’identità esatta della fonte e le evidenze di mappatura.
- Claude Fable 5.1 Max EffortAnthropic · Objective attività#183.41Published benchmark configuration
- Claude Fable 5 Max EffortAnthropic · Objective attività#282.97Published benchmark configuration
- GPT-6 Astra Max EffortOpenAI · Objective attività#382.16Published benchmark configuration
- Muse Spark 1.3 xHigh EffortMeta · Objective attività#481.59Published benchmark configuration
- GPT-5.6 Sol Max EffortOpenAI · Objective attività#581.05Published benchmark configuration
- GPT-5.5 Thinking xHigh EffortOpenAI · Objective attività#680.19Published benchmark configuration
- Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
- GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
- Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
- DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
- DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
- DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
- Kimi K3Moonshot AI · Open-weight models#179.19Pesi aperti
- Qwen 3.8 MaxAlibaba · Open-weight models#278.46Pesi aperti
- DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Pesi aperti
- DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Pesi aperti
- Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Pesi aperti
- GLM-5.3Z.AI · Open-weight models#676.14Pesi aperti