Fuentes de clasificaciones públicas

Datos de clasificación de modelos de AI de LiveBench

OpenGPT conserva 30 registros de LiveBench publicados dentro del alcance original de su fuente. No repite ni combina esta clasificación con otra prueba de referencia.

Registros publicados
30
Vistas de clasificación
Objective tasks · Cost per score point · Open-weight models
Fecha de los datos de la fuente
Consultado

Alcance de la evidencia

LiveBench-2026-06-25. 51 configuraciones de modelos publicadas en veintitrés tareas objetivas y siete categorías; las preguntas se actualizan cada seis meses.

How OpenGPT handles this evidence

OpenGPT almacena las etiquetas, posiciones, configuraciones, fechas y valores del editor dentro del mismo alcance publicado. No convierte los valores que faltan en cero ni combina esta fuente en una puntuación entre fuentes.

Límites de la comparación

  • Las posiciones y los valores solo son comparables dentro de la publicación y el alcance de clasificación indicados.
  • Una configuración incluida en la fuente solo se vincula a un ID oficial de modelo cuando se ha revisado la evidencia de identidad.
  • Las clasificaciones publicadas son señales de filtrado; antes de elegir para producción, hay que probar la versión exacta con trabajo real.

LiveBench-2026-06-25

Mostrando 18 filas representativas de 30 registros publicados. Siga una fila para consultar la identidad exacta de la fuente y las evidencias de correspondencia.

  1. Claude Fable 5.1 Max EffortAnthropic · Objective tareas#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · Objective tareas#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · Objective tareas#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · Objective tareas#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · Objective tareas#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · Objective tareas#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · Open-weight models#179.19Abrir pesos
  14. Qwen 3.8 MaxAlibaba · Open-weight models#278.46Abrir pesos
  15. DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Abrir pesos
  16. DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Abrir pesos
  17. Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Abrir pesos
  18. GLM-5.3Z.AI · Open-weight models#676.14Abrir pesos