Nenhum modelo atende a todos os requisitos
Revise qual requisito excluiu cada candidato e flexibilize apenas uma restrição que seja realmente flexível.
Revisar requisitosEncontre o fluxo de trabalho certo, siga cada etapa e entenda o que o resultado pode ou não revelar.
Cada fluxo responde a uma pergunta diferente. Comece pelo objetivo mais próximo e siga o guia vinculado.
Veja o que é classificado, de onde vieram os dados e quais registros incluem um ID oficial de modelo.
Use cada perspectiva de classificação para examinar os sinais publicados, revisar os registros das fontes e criar uma pré-seleção para testes com tarefas reais.
Comece com a pergunta que precisa responder. Preferência do usuário, capacidade geral, tarefas objetivas, custo e classificações de pesos abertos usam fontes e escalas diferentes.
Uma posição é relativa a uma fonte e um escopo. Empates podem fazer números de posição saltarem, e pontuações de diferentes perspectivas de ranking não são diretamente comparáveis.
O OpenGPT organiza dados públicos de terceiros e não repetiu essas avaliações. Nenhum ranking identifica o melhor modelo para todos os usuários ou tarefas.
Agora, cada linha contém detalhes do modelo e uma ação de comparação. O OpenGPT acrescenta um ID oficial de modelo somente quando a documentação do provedor comprova o mapeamento exato; caso contrário, a comparação dos registros da fonte preserva o nome do publicador, a configuração e os dados do ranking sem inventar um novo ID oficial.
Escolha um Agente conforme a tarefa, a configuração completa, a qualidade das evidências e os resultados comparáveis.
Explore 96 configurações publicadas de avaliação de Agentes em sete escopos de tarefas, além de 109 resultados separados de modelos para chamadas de ferramentas no BFCL, sem transformar evidências incompatíveis em uma única pontuação.
O resultado de um agente pertence a uma configuração completa: modelo base, scaffold, ferramentas, permissões, orçamento, ambiente, versão do benchmark e data. A OpenGPT preserva os campos informados pela fonte e deixa os ausentes sem dados, em vez de tratá-los como zero.
Uma posição descreve uma configuração completa do sistema dentro do escopo de um benchmark. Interprete-a com o grau de evidência, o frescor, a quantidade de amostras ou execuções e os campos de custo e confiabilidade informados.
O OpenGPT não cria uma pontuação universal de Agentes. A menos que um resultado esteja explicitamente marcado como reproduzido, o OpenGPT organiza as evidências da fonte em vez de repetir a avaliação; nenhum benchmark comprova a prontidão para produção em todos os fluxos de trabalho.
Um scaffold, uma versão de modelo, um conjunto de ferramentas, um nível de permissão, um orçamento ou uma configuração de benchmark diferentes criam uma configuração de agente distinta e devem permanecer como um registro separado.
Envie uma identidade pública ou um registro de evidências para revisão sem alterar as classificações.
Use o fluxo de envio quando faltar um ID oficial de modelo ou um produto de Agente, ou quando uma fonte pública precisar de revisão editorial.
Entre com uma conta verificada e prepare uma fonte HTTPS pública. Nunca envie credenciais, arquivos privados nem informações pessoais.
Um envio bem-sucedido recebe um número de referência e entra na fila de revisão. Um produto Agent aprovado é um registro do diretório público, não uma posição no ranking nem um endosso da OpenGPT.
Quem envia não pode definir posição, grau da evidência, comparabilidade nem status de publicação. Limites de duplicidade e frequência reduzem abusos, e a aprovação nunca altera automaticamente uma classificação.
Os produtos de Agente aprovados podem ser pesquisados no diretório, mas um ranking ainda exige evidências públicas de avaliação que sejam comparáveis.
Acompanhe a movimentação entre instantâneos comparáveis e compare os IDs dos modelos no catálogo.
Use esta página para ver o que mudou desde o instantâneo anterior da fonte, quais registros apareceram pela primeira vez, como as versões exatas diferem e quando os dados foram recuperados.
No momento, a movimentação histórica usa o escopo de preferência dos usuários da LMArena. Outras fontes ativas permanecem somente como atuais até que exista um instantâneo anterior comparável.
O OpenGPT calcula a movimentação somente quando fonte, escopo, unidade e método correspondem e mantém instantâneos mensais disponíveis para download.
Somente datas de lançamento documentadas pelo provedor são consideradas lançamentos de produtos. A comparação de versões não infere velocidade, preço, tamanho do contexto nem qualidade a partir dos nomes.
O OpenGPT não congelou uma edição anterior comparável para esta fonte ativa. Fontes pausadas permanecem históricas, em vez de contribuir para a movimentação atual.
Comece com um cenário de trabalho real e analise três versões oficiais de modelos que vale a pena testar primeiro.
Use as classificações por tarefa para transformar sinais públicos amplos em uma pré-seleção pequena e prática para programação, pesquisa, documentos, suporte, trabalho multilíngue, trabalho multimodal, custo, privacidade ou velocidade.
Escolha a tarefa mais próxima do seu trabalho e anote seus prompts, dados, ferramentas, região, orçamento e requisitos de privacidade reais. As evidências públicas exibidas podem abranger um escopo mais amplo do que a sua tarefa.
Você recebe três candidatos iniciais oficiais, evidências públicas visíveis quando disponíveis e caminhos diretos para comparar ou executar um teste com tarefas reais.
Um ranking por tarefa é uma lista inicial de finalistas, não um ranking universal nem uma prova do melhor modelo. Evidência ausente não é zero, e fontes públicas diferentes não são combinadas em uma única pontuação.
Uma versão oficial pode ser relevante para a tarefa por seu posicionamento de produto ou tipo de implantação, mesmo quando nenhum resultado da versão exata está mapeado na fonte pública selecionada. A evidência ausente permanece visível e deve ser resolvida por meio de um teste próprio.
Defina os modelos que você usa, os trabalhos recorrentes e as prioridades; depois, analise sinais cautelosos para saber quando vale a pena fazer uma comparação justa.
Use o Radar para responder a uma questão prática: há evidências públicas comparáveis suficientes para testar uma alternativa ao modelo que você usa atualmente?
Escolha versões oficiais exatas, pelo menos uma tarefa recorrente e até duas prioridades. Use o mesmo navegador e dispositivo, pois a configuração permanece local.
O Radar cria uma verificação de atualização local no dispositivo com um modelo atual, uma alternativa adequada à tarefa quando disponível, a data das evidências, os limites da incerteza e ações diretas de comparação.
Uma verificação de atualização não é uma instrução para trocar. Custo, velocidade, privacidade ou contexto ainda podem exigir testes diretos, e as configurações locais não são sincronizadas nem incluídas em backup.
Não. Isso significa que um sinal comparável ou uma alteração no ciclo de vida justifica um teste na mesma tarefa. Só mude depois que a alternativa tiver êxito no seu trabalho real e dentro das suas restrições.
Transforme quatro requisitos práticos em uma pré-seleção explicável.
Use a busca quando souber qual trabalho precisa fazer, mas não souber qual família de modelos investigar primeiro.
Saiba qual é a tarefa principal, onde o modelo pode ser executado, sua prioridade operacional mais importante e qualquer requisito de idioma.
O rótulo qualitativo e a quantidade de correspondências de requisitos se aplicam à série de modelos, não a versões individuais; nenhum dos dois é uma pontuação de benchmark. Confirme a disponibilidade de implantação de cada versão atual listada e compare os candidatos nas mesmas tarefas.
A busca não chama modelos, não verifica preços atuais nem indica um vencedor universal. Uma série pode incluir versões com capacidades diferentes.
A ordem reflete as restrições selecionadas, não a popularidade geral. Altere um requisito para ver o que causou o resultado e depois teste versões exatas.
Explore IDs de modelos documentados pelos provedores, abra páginas específicas com os detalhes e verifique se há dados públicos de ranking comparáveis.
Use o diretório quando precisar de um ID oficial exato do modelo, destino do provedor, tarefas adequadas e inadequadas, fontes e um status claro dos dados de classificação.
Informe o nome de um modelo, um provedor, uma necessidade de implantação ou uma tarefa. Um ID de modelo documentado pelo provedor não garante a existência de dados públicos de avaliação comparáveis.
Classificado significa que dados publicados comparáveis estão vinculados ao ID exato do modelo. Não classificado significa que esta edição não tem um registro comparável adequado; não representa uma pontuação zero.
A documentação do provedor estabelece a identidade no catálogo, não a disponibilidade atual em todos os países ou níveis de serviço. A cobertura da classificação, os detalhes dos modelos e os termos do provedor podem mudar após a data da revisão.
Não. Isso significa que esta edição não possui dados públicos comparáveis adequados para esse ID de modelo. Teste-o diretamente se ele continuar relevante para sua decisão.
Compare de duas a quatro versões oficiais exatas ou registros de uma única visualização publicada de ranking.
A comparação de versões oficiais organiza IDs documentados pelos provedores entre as fontes publicadas. A comparação de registros da fonte preserva o nome e as configurações do publicador quando uma comparação oficial exata faria perder informações.
Para versões oficiais, escolha de dois a quatro IDs do catálogo. Para registros da fonte, escolha de duas a quatro linhas da mesma fonte, dimensão e instantâneo.
A comparação cria uma pré-seleção ciente das evidências e mostra onde faltam informações. Ela não produz uma nova pontuação de benchmark nem declara um vencedor universal.
O OpenGPT não chama os modelos nesta visualização. Pontuações publicadas de fontes ou escopos diferentes não são intercambiáveis, e os detalhes dos modelos podem mudar após a data de revisão.
A comparação de dados resume informações já publicadas sobre dois a quatro modelos. A avaliação em tarefas reais recebe exatamente duas versões, solicita que você execute os mesmos prompts nos dois serviços e analisa as respostas coladas sem exibir os rótulos dos modelos.
Mantenha neste navegador uma pequena lista de trabalho com entradas do ranking.
Use Meus modelos para retornar rapidamente aos candidatos, abrir destinos confiáveis e levar IDs de modelos compatíveis para uma comparação.
Use o mesmo navegador e dispositivo. A lista é armazenada localmente, sem uma conta do OpenGPT nem sincronização com a nuvem.
A contagem ao lado de Meus modelos mostra quantas entradas estão salvas. A identidade da fonte e a identidade oficial do modelo permanecem separadas.
A lista não é uma conta, sincronização de favoritos nem backup. Outro navegador ou dispositivo não a verá, e a navegação privada, as restrições de armazenamento ou a limpeza dos dados do site podem removê-la.
Confirme que você está usando o mesmo perfil de navegador e o mesmo dispositivo. Se o armazenamento do site tiver sido limpo ou bloqueado, o OpenGPT não conseguirá restaurar a lista local.
Execute um teste privado em trabalhos reais; o modo temporário mantém as saídas brutas na memória, a menos que você decida retê-las neste dispositivo.
Comparar de 2 a 4 configurações exatas de Modelo ou Agente com um Pacote de Tarefas controlado e auditável.
Registre cada configuração exata, abra os serviços relevantes dos provedores, remova dados sigilosos e lembre-se de que as políticas dos provedores se aplicam a tudo o que você enviar a eles.
O resultado foi confirmado pelo usuário e está vinculado ao Pacote de tarefas congelado e às configurações registradas. A exportação somente de metadados é o padrão; a exportação completa das saídas brutas exige consentimento explícito e pode ser verificada localmente.
Ocultar os rótulos reduz o viés do nome visível, mas não constitui um teste duplo-cego. O OpenGPT não executa os provedores nem comprova a origem dos resultados, a exatidão da configuração, a completude, a privacidade nos provedores externos ou a generalização para além destas tarefas. Resultados de testes privados são Testados no seu trabalho, não Evidências públicas.
O teste é executado no navegador. O modo temporário mantém as saídas brutas na memória; a retenção neste dispositivo é opcional. A exportação de metadados exclui as saídas brutas, e a exportação completa exige consentimento explícito.
Reutilize os mesmos prompts reais em uma avaliação futura de modelos sem recriar o conjunto de tarefas.
Use conjuntos de tarefas salvos para tornar as comparações futuras mais consistentes e reavaliar versões exatas dos modelos após um lançamento ou uma mudança nos dados públicos.
Preencha os títulos e prompts das tarefas, escolha um nome claro para o conjunto de tarefas e use o mesmo navegador e dispositivo. Como um conjunto de tarefas pode conter texto confidencial do trabalho, remova dados privados antes de salvar.
O nome, o modelo e o idioma do conjunto de tarefas, além dos títulos e prompts, são armazenados localmente para reutilização. A reavaliação inicia uma execução limpa, preservando as entradas pretendidas do teste.
Os conjuntos de tarefas salvos existem apenas neste dispositivo e não são sincronizados nem incluídos em backups. Respostas, escolhas de modelos, revisões, relatórios e chaves de API não são salvos em um conjunto de tarefas. Limpar os dados do site pode remover todos os conjuntos salvos.
O OpenGPT mantém as mesmas tarefas e versões exatas dos modelos e depois limpa as respostas, pontuações e avaliações anteriores, o estado de revelação e o relatório, para que a próxima execução seja independente do resultado antigo.
Verificar a estrutura e a consistência interna dos relatórios JSON compatíveis, além de padrões que possam indicar segredos e uma impressão digital local.
Use o verificador para examinar um pacote OpenGPT Evidence v1 ou v2 ou um relatório V3 baixado do Espaço de Decisões. Todas as verificações são executadas localmente neste navegador.
Obtenha o arquivo JSON original. Para um relatório de comparação, baixe-o no Espaço de Decisões; primeiro conclua todos os casos se precisar de um resultado concluído em vez de um rascunho.
No Evidence v1/v2, Passed significa que o pacote segue as regras compatíveis de estrutura e consistência, enquanto Demo identifica um exemplo. Em um relatório de comparação, Passed significa que um relatório concluído é internamente consistente; Draft significa que a estrutura é válida, mas a comparação não foi concluída. Failed significa que pelo menos uma verificação obrigatória precisa ser revisada.
Uma aprovação não comprova que o modelo indicado produziu as respostas coladas, que as alegações do provedor são verdadeiras ou que o resultado se aplica além dos testes registrados. Resultados de arquivos sem relação não são automaticamente comparáveis.
Não. Isso confirma apenas que o relatório compatível tem estrutura válida e consistência interna. Você ainda precisa avaliar a identidade do modelo, a qualidade dos testes, os resultados e a relevância para a decisão.
Saiba o que torna uma decisão sobre modelos inspecionável e reproduzível.
Use esta página antes de criar, publicar ou confiar em uma avaliação. Ela separa a qualidade das evidências da popularidade do modelo.
Comece com uma pergunta de decisão concreta, versões de modelos identificadas, tarefas representativas e um plano para preservar as saídas brutas.
O Evidence v1/v2 verifica principalmente o formato e as declarações. O Espaço de Decisões V3 permite recálculo local (L3); a reprodução independente no L4 continua sem suporte.
Um processo rigoroso pode reduzir vieses, mas não garante que uma amostra represente todos os usuários, idiomas, versões futuras ou condições de produção.
Ajuste o rigor às consequências. Um teste pessoal talvez precise apenas de L1; uma alegação pública ou de alto impacto deve buscar evidências independentes mais robustas.
Use estas definições quando um rótulo não for conhecido.
Revise qual requisito excluiu cada candidato e flexibilize apenas uma restrição que seja realmente flexível.
Revisar requisitosO publicador pode usar posições empatadas ou várias configurações. O OpenGPT preserva a posição original em vez de renumerar as linhas visíveis.
Revisar a classificaçãoA fonte não publicou um valor comparável. O OpenGPT o deixa sem informação em vez de tratá-lo como zero; compare apenas valores do mesmo escopo de benchmark.
Revisar evidências de AgentesÉ um registro completo da fonte, não um status não resolvido. Abra a fonte original; use o diretório de modelos quando precisar de identidade documentada pelo provedor e acesso oficial.
Revisar identidade da fonteUse o mesmo perfil de navegador e dispositivo. O modo privado, o bloqueio do armazenamento ou a limpeza dos dados do site podem remover a lista local.
Abrir Meus ModelosA comparação de dados aceita IDs de modelos do catálogo. O mesmo modelo talvez já esteja selecionado ou a lista pode ter atingido o limite de quatro modelos. Escolha outra versão do catálogo ou remova primeiro um candidato.
Abrir o diretório de modelosVolte ao teste e conclua toda saída obrigatória de configuração e tarefa, o status da revisão, a verificação de falhas críticas e o resultado confirmado pelo usuário.
Continuar no Laboratório de ProvasVolte a Comparar, revise o aviso sobre o rascunho local mais recente e decida explicitamente se deseja mantê-lo ou redefini-lo.
Revisar rascunho localUse o item reprovado na lista de verificação para corrigir o registro de origem. Não insira segredos nem reescreva resultados.
Abrir verificadorInforme um link quebrado, um detalhe incorreto de modelo ou um problema que você não conseguiu resolver.