Fontes das classificações públicas

Dados de ranking de modelos de IA da LiveBench

O OpenGPT preserva 30 registros LiveBench publicados dentro do escopo original da fonte. Ele não repete nem combina este ranking com outro benchmark.

Registros publicados
30
Visualizações da classificação
Objective tasks · Cost per score point · Open-weight models
Data dos dados da fonte
Recuperado

Escopo das evidências

LiveBench-2026-06-25. 51 configurações de modelos publicadas em vinte e três tarefas objetivas e sete categorias; as perguntas são atualizadas a cada seis meses.

How OpenGPT handles this evidence

O OpenGPT armazena os rótulos, as posições, as configurações, as datas e os valores do publicador dentro do mesmo escopo publicado. Ele não converte valores ausentes em zero nem combina esta fonte em uma pontuação entre fontes.

Limites da comparação

  • As posições e os valores só são comparáveis dentro da versão da fonte e do escopo de classificação indicados.
  • Uma configuração listada na fonte só é vinculada a um ID oficial de modelo quando a evidência de identidade foi revisada.
  • As classificações publicadas são sinais de triagem; a escolha para produção ainda exige testar a versão exata em trabalhos reais.

LiveBench-2026-06-25

Mostrando 18 linhas representativas de 30 registros publicados. Abra uma linha para examinar sua identidade exata na fonte e as evidências do mapeamento.

  1. Claude Fable 5.1 Max EffortAnthropic · Objective tarefas#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · Objective tarefas#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · Objective tarefas#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · Objective tarefas#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · Objective tarefas#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · Objective tarefas#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · Open-weight models#179.19Abrir pesos
  14. Qwen 3.8 MaxAlibaba · Open-weight models#278.46Abrir pesos
  15. DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Abrir pesos
  16. DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Abrir pesos
  17. Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Abrir pesos
  18. GLM-5.3Z.AI · Open-weight models#676.14Abrir pesos