Fonti delle classifiche pubbliche

Dati di classifica dei modelli di AI di LiveBench

OpenGPT conserva 30 record LiveBench pubblicati nel relativo ambito di origine. Non ripete né combina questa classifica con un altro benchmark.

Record pubblicati
30
Viste della classifica
Objective tasks · Cost per score point · Open-weight models
Data dei dati della fonte
Recuperato

Ambito delle evidenze

LiveBench-2026-06-25. 51 configurazioni di modelli pubblicate per ventitré attività oggettive e sette categorie; le domande vengono aggiornate ogni sei mesi.

How OpenGPT handles this evidence

OpenGPT memorizza etichette, posizioni, configurazioni, date e valori del publisher nello stesso ambito pubblicato. Non converte i valori mancanti in zero né aggrega questa fonte in un punteggio tra fonti diverse.

Limiti del confronto

  • Posizioni e valori sono comparabili soltanto all’interno della versione della fonte e dell’ambito di classifica indicati.
  • Una configurazione elencata dalla fonte viene collegata a un ID ufficiale del modello solo dopo la verifica delle evidenze sull’identità.
  • Le classifiche pubblicate sono segnali per una selezione preliminare; la scelta per la produzione richiede comunque di provare la versione esatta sul lavoro reale.

LiveBench-2026-06-25

Visualizzate 18 righe rappresentative ricavate da 30 registri pubblicati. Apri una riga per esaminarne l’identità esatta della fonte e le evidenze di mappatura.

  1. Claude Fable 5.1 Max EffortAnthropic · Objective attività#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · Objective attività#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · Objective attività#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · Objective attività#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · Objective attività#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · Objective attività#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · Open-weight models#179.19Pesi aperti
  14. Qwen 3.8 MaxAlibaba · Open-weight models#278.46Pesi aperti
  15. DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Pesi aperti
  16. DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Pesi aperti
  17. Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Pesi aperti
  18. GLM-5.3Z.AI · Open-weight models#676.14Pesi aperti