Decisiones independientes sobre modelos

Ranking de modelos de IA

Seleccione versiones exactas de modelos a partir de evidencias públicas, compárelas con una misma base y verifique después la elección con su propia tarea.

Tareas objetivasLiveBench · Mostrando 3 de 10
  1. Posición 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. Posición 2Claude Fable 5 Max EffortAnthropic82.97
  3. Posición 3GPT-6 Astra Max EffortOpenAI82.16
Datos de evaluaciones publicadas2 fuentes públicas externasLiveBench · Datos de esta edición hasta el

OpenGPT organiza y presenta datos públicos de evaluaciones de terceros; no volvió a probar estos modelos. Usa el ranking para entender su rendimiento relativo y valida los candidatos con tus propias tareas.

Edición de datos
2026-09Publicado ·
Alcance de las decisiones automatizadas
20 en verificación automatizada / 79 modelos del catálogoFecha límite de los datos · 2026-08-30
Instantánea actual de la clasificación · LiveBench
2026-09-07 · 56 registros de origen
Última edición de cambios comparables · LiveBench
Desconocido
Cobertura del ciclo de vida
36 estados de ciclo de vida documentados / 79 · 20 en el alcance de la automatizaciónFecha límite de los datos · 2026-08-30

Elige una perspectiva del ranking

Empiece con la decisión que necesita tomar. Cada escenario abre la señal de clasificación publicada más pertinente. La fuente y la escala originales permanecen visibles.

Elige qué mostrar

Muestra todos los registros publicados con el ID o nombre de modelo de la fuente, incluidos alias y configuraciones. Se conservan las posiciones de la fuente.

Tareas objetivas. Puntuación general de LiveBench en 23 tareas con evaluación objetiva, distribuidas en siete categorías.

Mostrando 10 de 10. Tareas objetivas.

  1. Posición 1
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    claude-fable-5-1-max-effort
    Tareas objetivas
    83.41
    Fuente original
  2. Posición 2
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    claude-fable-5-max-effort
    Tareas objetivas
    82.97
    Fuente original
  3. Posición 3
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    gpt-6-astra-max
    Tareas objetivas
    82.16
    Fuente original
  4. Posición 4
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    muse-spark-1.3-xhigh
    Tareas objetivas
    81.59
    Fuente original
  5. Posición 5
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    gpt-5.6-sol-max
    Tareas objetivas
    81.05
    Fuente original
  6. Posición 6
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    gpt-5.5-xhigh
    Tareas objetivas
    80.19
    Fuente original
  7. Posición 7
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    claude-opus-5-max-effort
    Tareas objetivas
    80.08
    Fuente original
  8. Posición 8

    Kimi K3

    Moonshot AI
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    kimi-k3
    Tareas objetivas
    79.19
    Fuente original
  9. Posición 9
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    gemini-3.7-flash-high
    Tareas objetivas
    78.83
    Fuente original
  10. Posición 10
    Ajustes del modelo
    Published benchmark configuration
    ID del modelo en la fuente
    qwen3.8-max
    Tareas objetivas
    78.46
    Fuente original
Fuente independienteLiveBench10 entradas publicadas · Fecha de captura: 9 sept 2026
LiveBench

Estado de la supervisiónEstado en directo no disponiblePublicación automática validada

Fecha de los datos de origen
Recuperado por OpenGPT
Último cambio del ranking

LMArena + LiveBench: publicación automática validada · Fuentes en pausa: uso exclusivamente histórico

Método de rankingCada vista conserva la métrica, la versión y la metodología de la fuente. Sigue los enlaces para auditar el trabajo subyacente.

Base del ranking

Clasificación publicada completa e ID oficiales de los modelos

La clasificación principal conserva todos los registros de los editores y muestra su ID de modelo o nombre en la fuente. Se pueden comparar todas las filas: las correspondencias exactas y seguras entre configuraciones utilizan versiones oficiales; las demás filas permanecen dentro de una única clasificación de origen. Los datos ausentes nunca se convierten en una puntuación de cero.
79 IDs oficiales de modelos
79
0 con datos públicos de clasificación
0
79 a la espera de datos comparables
79
LiveBench · 56 registros de origen conservados para auditoría
56
Directorio de modelos

Base del ranking

Cómo interpretar esta edición de investigación

  • Las puntuaciones se mantienen en las escalas originales de sus editores. No se combinan en una puntuación compuesta.

  • La ausencia de datos no significa cero. Significa que el editor no publicó esa métrica para esta instantánea.

  • Cuando una fuente indica los ajustes del modelo, la posición se aplica a esa configuración exacta y a esa publicación de la fuente, no a todas las tareas, regiones o formas de despliegue.

  • Ningún proveedor puede pagar por obtener una posición. OpenGPT enlaza directamente a las pruebas utilizadas.

Base del ranking

Datos y fuentes

Cada vista conserva la métrica, la versión y la metodología de la fuente. Sigue los enlaces para auditar el trabajo subyacente.
AR

LMArena

La clasificación general completa más reciente con control de estilo, basada en usuarios que comparan en paralelo dos respuestas de modelos.

Fecha de publicación del ranking
2 sept 2026
Fecha de captura
9 sept 2026
Licencia
CC BY 4.0

Ranking originalMetodología

LB

LiveBench

Veintitrés tareas objetivas en siete categorías; las preguntas se renuevan cada seis meses.

Versión de datos
LiveBench-2026-06-25
Fecha de captura
9 sept 2026
Licencia
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

Ranking originalMetodología

Versión del método

Un ritmo de publicación previsible

OpenGPT comprueba las fuentes de modelos activas cada seis horas. LMArena y LiveBench solo publican cuando superan sus políticas de validación versionadas. Las fuentes en pausa siguen siendo históricas y no se incorporan a las clasificaciones actuales.
  1. 01

    Revisión de fuentes cada 6 h

    Las actualizaciones de LMArena y LiveBench solo se publican automáticamente después de comprobar el esquema, la exhaustividad, la fecha, la integridad y las anomalías. Las fuentes en pausa se mantienen como históricas.

  2. 02

    Resumen semanal de cambios

    Resume los cambios relevantes de posiciones, modelos y fuentes en una actualización revisable.

  3. 03

    Instantánea histórica mensual

    Congela una instantánea fechada con las configuraciones exactas, las versiones de las fuentes y las correcciones.