Decisões independentes sobre modelos

Ranking de modelos de IA

Crie uma pré-seleção de versões exatas de modelos a partir de evidências públicas, compare-as com uma única base e depois verifique a escolha na sua própria tarefa.

Tarefas objetivasLiveBench · Exibindo 3 de 10
  1. Posição 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. Posição 2Claude Fable 5 Max EffortAnthropic82.97
  3. Posição 3GPT-6 Astra Max EffortOpenAI82.16
Dados de avaliações publicadas2 fontes públicas externasLiveBench · Dados desta edição até

OpenGPT organiza e apresenta dados públicos de avaliações feitas por terceiros; não refez os testes desses modelos. Use o ranking para entender o desempenho relativo e valide os candidatos nas suas próprias tarefas.

Edição dos dados
2026-09Publicado ·
Escopo da decisão automatizada
20 na verificação automatizada / 79 modelos do catálogoData-limite dos dados · 2026-08-30
Instantâneo atual do ranking · LiveBench
2026-09-07 · 56 registros de origem
Edição mais recente com alterações comparáveis · LiveBench
Desconhecido
Cobertura do ciclo de vida
36 estados de ciclo de vida documentados / 79 · 20 no escopo da automaçãoData-limite dos dados · 2026-08-30

Escolha uma perspectiva do ranking

Comece com a decisão que precisa tomar. Cada cenário abre o sinal de ranking publicado mais relevante. A fonte e a escala originais permanecem visíveis.

Escolha o que mostrar

Mostra todos os registros publicados com o ID ou nome de modelo da fonte, incluindo aliases e configurações. As posições da fonte são preservadas.

Tarefas objetivas. Pontuação geral do LiveBench em 23 tarefas avaliadas objetivamente em sete categorias.

Exibindo 10 de 10. Tarefas objetivas.

  1. Posição 1
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    claude-fable-5-1-max-effort
    Tarefas objetivas
    83.41
    Fonte original
  2. Posição 2
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    claude-fable-5-max-effort
    Tarefas objetivas
    82.97
    Fonte original
  3. Posição 3
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    gpt-6-astra-max
    Tarefas objetivas
    82.16
    Fonte original
  4. Posição 4
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    muse-spark-1.3-xhigh
    Tarefas objetivas
    81.59
    Fonte original
  5. Posição 5
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    gpt-5.6-sol-max
    Tarefas objetivas
    81.05
    Fonte original
  6. Posição 6
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    gpt-5.5-xhigh
    Tarefas objetivas
    80.19
    Fonte original
  7. Posição 7
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    claude-opus-5-max-effort
    Tarefas objetivas
    80.08
    Fonte original
  8. Posição 8

    Kimi K3

    Moonshot AI
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    kimi-k3
    Tarefas objetivas
    79.19
    Fonte original
  9. Posição 9
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    gemini-3.7-flash-high
    Tarefas objetivas
    78.83
    Fonte original
  10. Posição 10
    Configurações do modelo
    Published benchmark configuration
    ID do modelo na fonte
    qwen3.8-max
    Tarefas objetivas
    78.46
    Fonte original
Fonte independenteLiveBench10 entradas publicadas · Data da coleta: 9 de set. de 2026
LiveBench

Status do monitoramentoStatus em tempo real indisponívelPublicação automática validada

Data dos dados da fonte
Coletado pelo OpenGPT
Última mudança no ranking

LMArena + LiveBench: publicação automática validada · fontes pausadas: somente histórico

Método do rankingCada visualização preserva a métrica, a versão e a metodologia da fonte. Siga os links para auditar o trabalho subjacente.

Base do ranking

Ranking publicado completo e IDs oficiais de modelos

A classificação principal preserva todos os registros dos publicadores e mostra o ID ou nome do modelo na fonte. Todas as linhas podem ser comparadas: mapeamentos exatos e seguros quanto à configuração usam versões oficiais; as demais permanecem dentro de uma única classificação da fonte. Dados ausentes nunca se tornam uma pontuação zero.
79 IDs oficiais de modelos
79
0 com dados públicos de ranking
0
79 aguardando dados comparáveis
79
LiveBench · 56 registros de origem mantidos para auditoria
56
Diretório de modelos

Base do ranking

Como interpretar esta edição da pesquisa

  • As pontuações permanecem nas escalas originais dos publicadores. Elas não são combinadas em uma pontuação composta.

  • Dados ausentes não significam zero. Significam que o publicador não informou essa métrica para este instantâneo.

  • Quando uma fonte informa as configurações do modelo, a posição se aplica àquela configuração exata e àquela versão da fonte, não a todas as tarefas, regiões ou implantações.

  • Nenhum provedor pode pagar por uma posição. O OpenGPT fornece links diretos para as evidências usadas.

Base do ranking

Dados e fontes

Cada visualização preserva a métrica, a versão e a metodologia da fonte. Siga os links para auditar o trabalho subjacente.
AR

LMArena

A classificação geral completa e mais recente com estilo controlado, baseada em usuários que comparam lado a lado duas respostas de modelos.

Data de publicação do ranking
2 de set. de 2026
Data da coleta
9 de set. de 2026
Licença
CC BY 4.0

Ranking originalMetodologia

LB

LiveBench

Vinte e três tarefas objetivas em sete categorias; as perguntas são renovadas a cada seis meses.

Versão dos dados
LiveBench-2026-06-25
Data da coleta
9 de set. de 2026
Licença
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

Ranking originalMetodologia

Versão do método

Um ritmo de publicação previsível

O OpenGPT verifica as fontes de modelos ativas a cada seis horas. A LMArena e o LiveBench só publicam depois que suas políticas de validação com versão são aprovadas. Fontes pausadas permanecem históricas e não entram nos rankings atuais.
  1. 01

    Verificação das fontes a cada 6 h

    As atualizações da LMArena e do LiveBench só são publicadas automaticamente após as verificações de esquema, completude, data, integridade e anomalias. Fontes pausadas permanecem históricas.

  2. 02

    Resumo semanal de mudanças

    Resume mudanças relevantes de posições, modelos e fontes em uma atualização revisável.

  3. 03

    Snapshot histórico mensal

    Congela um snapshot datado com configurações exatas, versões das fontes e correções.