GUIAS E SUPORTE

Central de Ajuda do OpenGPT

Encontre o fluxo de trabalho certo, siga cada etapa e entenda o que o resultado pode ou não revelar.

Comece com o que deseja fazer

Cada fluxo responde a uma pergunta diferente. Comece pelo objetivo mais próximo e siga o guia vinculado.

1Rankings de modelosEntenda os sinais publicados e o status da identidade.2Rankings de AgentsEscolha configurações completas de Agentes conforme a tarefa e as evidências.3EscolherReduza os candidatos com base em requisitos reais.4Comparar dados públicosColoque de dois a quatro IDs de modelos do catálogo lado a lado.5Salvar modelosMantenha uma lista local de finalistas neste navegador.6Executar um teste no Proof LabTeste de 2 a 4 configurações exatas de Modelos ou Agentes em um Pacote de tarefas congelado.7Enviar ou corrigir evidênciasEnvie uma fonte pública de modelo ou Agente para revisão editorial.8Verificar um relatórioVerifique localmente um relatório JSON do OpenGPT antes de compartilhá-lo.

01

Rankings de modelos de IA

Veja o que é classificado, de onde vieram os dados e quais registros incluem um ID oficial de modelo.

Aberto

Para que serve este recurso

Use cada perspectiva de classificação para examinar os sinais publicados, revisar os registros das fontes e criar uma pré-seleção para testes com tarefas reais.

Antes de começar

Comece com a pergunta que precisa responder. Preferência do usuário, capacidade geral, tarefas objetivas, custo e classificações de pesos abertos usam fontes e escalas diferentes.

Tutorial passo a passo

  1. 1Escolha a perspectiva do ranking que corresponde à sua decisão.
  2. 2Use Ranking completo da fonte para todos os registros dos publicadores ou IDs oficiais de modelos para registros vinculados pela documentação do provedor.
  3. 3Analise em conjunto a posição na fonte, a faixa de pontuação, os votos, a licença e a configuração.
  4. 4Abra os Detalhes do modelo em qualquer linha. Mapeamentos oficiais exatos usam o perfil oficial; todas as outras linhas abrem um perfil da fonte que preserva o nome e a configuração publicados.
  5. 5Adicione qualquer linha à comparação. Mapeamentos exatos e seguros para a configuração usam a comparação de versões oficiais; todas as outras linhas usam a comparação de registros de origem na mesma fonte, dimensão e instantâneo.

Como interpretar o resultado

Uma posição é relativa a uma fonte e um escopo. Empates podem fazer números de posição saltarem, e pontuações de diferentes perspectivas de ranking não são diretamente comparáveis.

O que isso não pode comprovar

O OpenGPT organiza dados públicos de terceiros e não repetiu essas avaliações. Nenhum ranking identifica o melhor modelo para todos os usuários ou tarefas.

Pergunta frequente: Por que algumas linhas mostram apenas um ID ou nome de modelo da fonte?

Agora, cada linha contém detalhes do modelo e uma ação de comparação. O OpenGPT acrescenta um ID oficial de modelo somente quando a documentação do provedor comprova o mapeamento exato; caso contrário, a comparação dos registros da fonte preserva o nome do publicador, a configuração e os dados do ranking sem inventar um novo ID oficial.

Voltar ao topo
02

Rankings de Agentes de IA

Escolha um Agente conforme a tarefa, a configuração completa, a qualidade das evidências e os resultados comparáveis.

Aberto

Para que serve este recurso

Explore 96 configurações publicadas de avaliação de Agentes em sete escopos de tarefas, além de 109 resultados separados de modelos para chamadas de ferramentas no BFCL, sem transformar evidências incompatíveis em uma única pontuação.

Antes de começar

O resultado de um agente pertence a uma configuração completa: modelo base, scaffold, ferramentas, permissões, orçamento, ambiente, versão do benchmark e data. A OpenGPT preserva os campos informados pela fonte e deixa os ausentes sem dados, em vez de tratá-los como zero.

Tutorial passo a passo

  1. 1Escolha a categoria de tarefa correspondente ao seu trabalho.
  2. 2Verifique o escopo e a versão do benchmark, a data da avaliação, a atualidade e a nota de auditoria antes de consultar a posição no ranking.
  3. 3Use o grau da evidência para distinguir resultados reproduzidos ou verificados de execuções públicas transparentes e resultados informados pelo fornecedor.
  4. 4Compare êxito, evidências de execuções repetidas, duração e intervenção somente quando a fonte os informar nas mesmas condições. O OpenGPT só exibe o custo por êxito quando o total publicado e o denominador de tarefas/execuções usam o mesmo escopo verificado.
  5. 5Acompanhe configurações úteis, consulte o histórico delas e selecione de duas a quatro entradas do mesmo grupo comparável para uma visualização lado a lado.

Como interpretar o resultado

Uma posição descreve uma configuração completa do sistema dentro do escopo de um benchmark. Interprete-a com o grau de evidência, o frescor, a quantidade de amostras ou execuções e os campos de custo e confiabilidade informados.

O que isso não pode comprovar

O OpenGPT não cria uma pontuação universal de Agentes. A menos que um resultado esteja explicitamente marcado como reproduzido, o OpenGPT organiza as evidências da fonte em vez de repetir a avaliação; nenhum benchmark comprova a prontidão para produção em todos os fluxos de trabalho.

Pergunta frequente: Por que o mesmo agente ou modelo pode aparecer mais de uma vez?

Um scaffold, uma versão de modelo, um conjunto de ferramentas, um nível de permissão, um orçamento ou uma configuração de benchmark diferentes criam uma configuração de agente distinta e devem permanecer como um registro separado.

Voltar ao topo
03

Enviar um modelo ou Agente

Envie uma identidade pública ou um registro de evidências para revisão sem alterar as classificações.

Aberto

Para que serve este recurso

Use o fluxo de envio quando faltar um ID oficial de modelo ou um produto de Agente, ou quando uma fonte pública precisar de revisão editorial.

Antes de começar

Entre com uma conta verificada e prepare uma fonte HTTPS pública. Nunca envie credenciais, arquivos privados nem informações pessoais.

Tutorial passo a passo

  1. 1Escolha Modelo ou Agente na parte superior do formulário.
  2. 2Informe o nome público exato, o provedor ou a organização e os campos de identidade solicitados.
  3. 3Escolha o tipo de fonte e forneça o link para a documentação oficial, um repositório público ou o resultado de um benchmark público.
  4. 4Explique o que o revisor deve verificar e depois envie uma única vez.
  5. 5Acompanhe o status da revisão em seus envios recentes. Um produto de Agente aprovado é listado automaticamente no diretório pesquisável de Agentes; a classificação é um processo separado.

Como interpretar o resultado

Um envio bem-sucedido recebe um número de referência e entra na fila de revisão. Um produto Agent aprovado é um registro do diretório público, não uma posição no ranking nem um endosso da OpenGPT.

O que isso não pode comprovar

Quem envia não pode definir posição, grau da evidência, comparabilidade nem status de publicação. Limites de duplicidade e frequência reduzem abusos, e a aprovação nunca altera automaticamente uma classificação.

Pergunta frequente: Por que um envio aprovado não foi adicionado à classificação?

Os produtos de Agente aprovados podem ser pesquisados no diretório, mas um ranking ainda exige evidências públicas de avaliação que sejam comparáveis.

Voltar ao topo
04

Alterações do ranking e histórico de versões

Acompanhe a movimentação entre instantâneos comparáveis e compare os IDs dos modelos no catálogo.

Aberto

Para que serve este recurso

Use esta página para ver o que mudou desde o instantâneo anterior da fonte, quais registros apareceram pela primeira vez, como as versões exatas diferem e quando os dados foram recuperados.

Antes de começar

No momento, a movimentação histórica usa o escopo de preferência dos usuários da LMArena. Outras fontes ativas permanecem somente como atuais até que exista um instantâneo anterior comparável.

Tutorial passo a passo

  1. 1Verifique a data da fonte, a linha de base da comparação, a data de recuperação e a regra de comparação.
  2. 2Consulte Maiores altas apenas entre os registros presentes nos dois instantâneos.
  3. 3Trate Primeira aparição como uma nova entrada na fonte, não como uma data oficial de lançamento.
  4. 4Filtre a tabela de movimentações por alta, queda, sem alteração, primeira aparição ou ausência na lista atual.
  5. 5Compare dois IDs de modelos do catálogo e baixe um instantâneo da fonte quando precisar de uma trilha de auditoria.

Como interpretar o resultado

O OpenGPT calcula a movimentação somente quando fonte, escopo, unidade e método correspondem e mantém instantâneos mensais disponíveis para download.

O que isso não pode comprovar

Somente datas de lançamento documentadas pelo provedor são consideradas lançamentos de produtos. A comparação de versões não infere velocidade, preço, tamanho do contexto nem qualidade a partir dos nomes.

Pergunta frequente: Por que o LiveBench não mostra movimentação na classificação?

O OpenGPT não congelou uma edição anterior comparável para esta fonte ativa. Fontes pausadas permanecem históricas, em vez de contribuir para a movimentação atual.

Voltar ao topo
05

Classificações por tarefa

Comece com um cenário de trabalho real e analise três versões oficiais de modelos que vale a pena testar primeiro.

Aberto

Para que serve este recurso

Use as classificações por tarefa para transformar sinais públicos amplos em uma pré-seleção pequena e prática para programação, pesquisa, documentos, suporte, trabalho multilíngue, trabalho multimodal, custo, privacidade ou velocidade.

Antes de começar

Escolha a tarefa mais próxima do seu trabalho e anote seus prompts, dados, ferramentas, região, orçamento e requisitos de privacidade reais. As evidências públicas exibidas podem abranger um escopo mais amplo do que a sua tarefa.

Tutorial passo a passo

  1. 1Abra o cenário de tarefa mais próximo da decisão que você precisa tomar.
  2. 2Saiba por que as três versões oficiais foram selecionadas e o que permanece incerto.
  3. 3Consulte, para cada candidato, a fonte pública, a posição ou o valor na fonte, a data de revisão do mapeamento e a data-limite dos dados.
  4. 4Selecione dois ou três candidatos para comparar dados públicos lado a lado.
  5. 5Abra a avaliação em tarefas reais com os dois primeiros candidatos, edite o conjunto de tarefas de exemplo e teste ambos com configurações comparáveis.

Como interpretar o resultado

Você recebe três candidatos iniciais oficiais, evidências públicas visíveis quando disponíveis e caminhos diretos para comparar ou executar um teste com tarefas reais.

O que isso não pode comprovar

Um ranking por tarefa é uma lista inicial de finalistas, não um ranking universal nem uma prova do melhor modelo. Evidência ausente não é zero, e fontes públicas diferentes não são combinadas em uma única pontuação.

Pergunta frequente: Por que um candidato inicial pode não ter um resultado público comparável?

Uma versão oficial pode ser relevante para a tarefa por seu posicionamento de produto ou tipo de implantação, mesmo quando nenhum resultado da versão exata está mapeado na fonte pública selecionada. A evidência ausente permanece visível e deve ser resolvida por meio de um teste próprio.

Voltar ao topo
06

Radar de Atualização de Modelos

Defina os modelos que você usa, os trabalhos recorrentes e as prioridades; depois, analise sinais cautelosos para saber quando vale a pena fazer uma comparação justa.

Aberto

Para que serve este recurso

Use o Radar para responder a uma questão prática: há evidências públicas comparáveis suficientes para testar uma alternativa ao modelo que você usa atualmente?

Antes de começar

Escolha versões oficiais exatas, pelo menos uma tarefa recorrente e até duas prioridades. Use o mesmo navegador e dispositivo, pois a configuração permanece local.

Tutorial passo a passo

  1. 1Escolha as versões oficiais exatas que você usa atualmente; modelos salvos não são considerados atuais por padrão.
  2. 2Selecione tarefas recorrentes e até duas prioridades, como qualidade, custo, velocidade, privacidade ou contexto longo.
  3. 3Revise se vale a pena comparar cada modelo, se é seguro continuar monitorando-o ou se ele está próximo da descontinuação.
  4. 4Analise as evidências públicas comparáveis e depois teste os dois modelos no mesmo trabalho real.
  5. 5Revise as mudanças semanais ou assine o feed RSS público de mudanças nas classificações.

Como interpretar o resultado

O Radar cria uma verificação de atualização local no dispositivo com um modelo atual, uma alternativa adequada à tarefa quando disponível, a data das evidências, os limites da incerteza e ações diretas de comparação.

O que isso não pode comprovar

Uma verificação de atualização não é uma instrução para trocar. Custo, velocidade, privacidade ou contexto ainda podem exigir testes diretos, e as configurações locais não são sincronizadas nem incluídas em backup.

Pergunta frequente: “Vale a pena comparar” significa que devo substituir meu modelo atual?

Não. Isso significa que um sinal comparável ou uma alteração no ciclo de vida justifica um teste na mesma tarefa. Só mude depois que a alternativa tiver êxito no seu trabalho real e dentro das suas restrições.

Voltar ao topo
07

Escolha um modelo de IA

Transforme quatro requisitos práticos em uma pré-seleção explicável.

Aberto

Para que serve este recurso

Use a busca quando souber qual trabalho precisa fazer, mas não souber qual família de modelos investigar primeiro.

Antes de começar

Saiba qual é a tarefa principal, onde o modelo pode ser executado, sua prioridade operacional mais importante e qualquer requisito de idioma.

Tutorial passo a passo

  1. 1Escolha a tarefa mais próxima do seu trabalho real.
  2. 2Defina o limite da implantação, especialmente quando os dados não puderem sair do seu ambiente.
  3. 3Escolha a prioridade da qual você menos aceita abrir mão.
  4. 4Defina a necessidade de idiomas e depois revise os motivos da correspondência, os riscos e a próxima etapa de validação para cada candidato.
  5. 5Leve os candidatos mais fortes para uma avaliação com tarefas reais e teste versões exatas dos modelos nas mesmas tarefas.

Como interpretar o resultado

O rótulo qualitativo e a quantidade de correspondências de requisitos se aplicam à série de modelos, não a versões individuais; nenhum dos dois é uma pontuação de benchmark. Confirme a disponibilidade de implantação de cada versão atual listada e compare os candidatos nas mesmas tarefas.

O que isso não pode comprovar

A busca não chama modelos, não verifica preços atuais nem indica um vencedor universal. Uma série pode incluir versões com capacidades diferentes.

Pergunta frequente: Por que um modelo famoso não apareceu em primeiro lugar?

A ordem reflete as restrições selecionadas, não a popularidade geral. Altere um requisito para ver o que causou o resultado e depois teste versões exatas.

Voltar ao topo
08

Diretório e detalhes dos modelos

Explore IDs de modelos documentados pelos provedores, abra páginas específicas com os detalhes e verifique se há dados públicos de ranking comparáveis.

Aberto

Para que serve este recurso

Use o diretório quando precisar de um ID oficial exato do modelo, destino do provedor, tarefas adequadas e inadequadas, fontes e um status claro dos dados de classificação.

Antes de começar

Informe o nome de um modelo, um provedor, uma necessidade de implantação ou uma tarefa. Um ID de modelo documentado pelo provedor não garante a existência de dados públicos de avaliação comparáveis.

Tutorial passo a passo

  1. 1Busque por modelo, versão, provedor ou tarefa.
  2. 2Filtre por método de implantação e pelo status classificado ou atualmente não classificado.
  3. 3Abra a página de detalhes de um modelo para consultar a identidade, o uso pretendido, a cobertura de dados públicos, os pontos fortes, as limitações, as fontes e a data de revisão.
  4. 4Use o destino oficial para verificar a disponibilidade, os preços, a privacidade e os limites atuais.
  5. 5Adicione de duas a quatro versões do catálogo à comparação de dados e depois leve dois finalistas para a avaliação com tarefas reais.

Como interpretar o resultado

Classificado significa que dados publicados comparáveis estão vinculados ao ID exato do modelo. Não classificado significa que esta edição não tem um registro comparável adequado; não representa uma pontuação zero.

O que isso não pode comprovar

A documentação do provedor estabelece a identidade no catálogo, não a disponibilidade atual em todos os países ou níveis de serviço. A cobertura da classificação, os detalhes dos modelos e os termos do provedor podem mudar após a data da revisão.

Pergunta frequente: Não estar no ranking significa que o modelo é fraco?

Não. Isso significa que esta edição não possui dados públicos comparáveis adequados para esse ID de modelo. Teste-o diretamente se ele continuar relevante para sua decisão.

Voltar ao topo
09

Comparação de dados

Compare de duas a quatro versões oficiais exatas ou registros de uma única visualização publicada de ranking.

Aberto

Para que serve este recurso

A comparação de versões oficiais organiza IDs documentados pelos provedores entre as fontes publicadas. A comparação de registros da fonte preserva o nome e as configurações do publicador quando uma comparação oficial exata faria perder informações.

Antes de começar

Para versões oficiais, escolha de dois a quatro IDs do catálogo. Para registros da fonte, escolha de duas a quatro linhas da mesma fonte, dimensão e instantâneo.

Tutorial passo a passo

  1. 1Adicione qualquer linha de um ranking. Mapeamentos seguros para a configuração usam a comparação de versões oficiais; todas as outras linhas usam a comparação de registros de origem.
  2. 2Os resultados oficiais permanecem separados por fonte e dimensão.
  3. 3Os resultados dos registros preservam o nome, as configurações, a posição e a pontuação publicados em uma escala comum da fonte.
  4. 4Dados ausentes permanecem desconhecidos, em vez de serem tratados como zero.
  5. 5Somente versões oficiais exatas podem avançar para a avaliação em tarefas reais depois que você escolher dois finalistas.

Como interpretar o resultado

A comparação cria uma pré-seleção ciente das evidências e mostra onde faltam informações. Ela não produz uma nova pontuação de benchmark nem declara um vencedor universal.

O que isso não pode comprovar

O OpenGPT não chama os modelos nesta visualização. Pontuações publicadas de fontes ou escopos diferentes não são intercambiáveis, e os detalhes dos modelos podem mudar após a data de revisão.

Pergunta frequente: Qual é a diferença entre comparação de dados e avaliação em tarefas reais?

A comparação de dados resume informações já publicadas sobre dois a quatro modelos. A avaliação em tarefas reais recebe exatamente duas versões, solicita que você execute os mesmos prompts nos dois serviços e analisa as respostas coladas sem exibir os rótulos dos modelos.

Voltar ao topo
10

Meus modelos

Mantenha neste navegador uma pequena lista de trabalho com entradas do ranking.

Aberto

Para que serve este recurso

Use Meus modelos para retornar rapidamente aos candidatos, abrir destinos confiáveis e levar IDs de modelos compatíveis para uma comparação.

Antes de começar

Use o mesmo navegador e dispositivo. A lista é armazenada localmente, sem uma conta do OpenGPT nem sincronização com a nuvem.

Tutorial passo a passo

  1. 1Selecione Salvar em qualquer linha da classificação.
  2. 2Abra Modelos salvos na navegação superior para revisar as entradas salvas.
  3. 3Cada registro de fonte salvo exibe o ID ou o nome do modelo na fonte. Registros com um ID oficial de modelo também podem abrir o destino do provedor ou entrar na comparação.
  4. 4Adicione dois IDs de modelos compatíveis diferentes e abra a comparação de dados públicos. Escolha dois finalistas ali antes de iniciar uma avaliação com tarefas reais.
  5. 5Remova as entradas de que você não precisa mais. Atualizar a página ou mudar o idioma do site mantém a lista no mesmo navegador.

Como interpretar o resultado

A contagem ao lado de Meus modelos mostra quantas entradas estão salvas. A identidade da fonte e a identidade oficial do modelo permanecem separadas.

O que isso não pode comprovar

A lista não é uma conta, sincronização de favoritos nem backup. Outro navegador ou dispositivo não a verá, e a navegação privada, as restrições de armazenamento ou a limpeza dos dados do site podem removê-la.

Pergunta frequente: Por que Meus modelos desapareceram?

Confirme que você está usando o mesmo perfil de navegador e o mesmo dispositivo. Se o armazenamento do site tiver sido limpo ou bloqueado, o OpenGPT não conseguirá restaurar a lista local.

Voltar ao topo
11

Proof Lab

Execute um teste privado em trabalhos reais; o modo temporário mantém as saídas brutas na memória, a menos que você decida retê-las neste dispositivo.

Aberto

Para que serve este recurso

Comparar de 2 a 4 configurações exatas de Modelo ou Agente com um Pacote de Tarefas controlado e auditável.

Antes de começar

Registre cada configuração exata, abra os serviços relevantes dos provedores, remova dados sigilosos e lembre-se de que as políticas dos provedores se aplicam a tudo o que você enviar a eles.

Tutorial passo a passo

  1. 1Escolha de 2 a 4 configurações exatas de Modelo ou Agente; não trate o nome de uma família como uma configuração reproduzível.
  2. 2Carregue um modelo de tarefa ou crie um Pacote de tarefas editável e depois congele-o antes de coletar resultados.
  3. 3Execute você mesmo cada tarefa congelada em todas as configurações e cole cada saída completa na matriz.
  4. 4Use uma revisão equilibrada e cega de todos os pares. Registre Pass, Fail, Inconclusive ou Not tested, além das falhas críticas; mantenha latência e custo como observações separadas e não crie uma pontuação geral sintética.
  5. 5Revise as evidências reveladas e confirme explicitamente o resultado da decisão. Exporte os metadados por padrão; inclua todas as saídas brutas somente após o consentimento e verifique localmente o pacote exportado.

Como interpretar o resultado

O resultado foi confirmado pelo usuário e está vinculado ao Pacote de tarefas congelado e às configurações registradas. A exportação somente de metadados é o padrão; a exportação completa das saídas brutas exige consentimento explícito e pode ser verificada localmente.

O que isso não pode comprovar

Ocultar os rótulos reduz o viés do nome visível, mas não constitui um teste duplo-cego. O OpenGPT não executa os provedores nem comprova a origem dos resultados, a exatidão da configuração, a completude, a privacidade nos provedores externos ou a generalização para além destas tarefas. Resultados de testes privados são Testados no seu trabalho, não Evidências públicas.

Pergunta frequente: O Proof Lab envia prompts ou resultados brutos?

O teste é executado no navegador. O modo temporário mantém as saídas brutas na memória; a retenção neste dispositivo é opcional. A exportação de metadados exclui as saídas brutas, e a exportação completa exige consentimento explícito.

Voltar ao topo
12

Conjuntos de tarefas salvos e reavaliação

Reutilize os mesmos prompts reais em uma avaliação futura de modelos sem recriar o conjunto de tarefas.

Aberto

Para que serve este recurso

Use conjuntos de tarefas salvos para tornar as comparações futuras mais consistentes e reavaliar versões exatas dos modelos após um lançamento ou uma mudança nos dados públicos.

Antes de começar

Preencha os títulos e prompts das tarefas, escolha um nome claro para o conjunto de tarefas e use o mesmo navegador e dispositivo. Como um conjunto de tarefas pode conter texto confidencial do trabalho, remova dados privados antes de salvar.

Tutorial passo a passo

  1. 1Na avaliação em tarefas reais, prepare ou edite um conjunto de tarefas que represente seu trabalho.
  2. 2Dê ao conjunto de tarefas um nome fácil de reconhecer e salve-o.
  3. 3Depois, escolha o conjunto de tarefas salvo e carregue-o na avaliação atual.
  4. 4Selecione duas versões exatas de modelos e execute todos os prompts com configurações comparáveis.
  5. 5A partir de um resultado concluído, escolha Reavaliar para manter as tarefas e versões dos modelos enquanto limpa as respostas antigas, avaliações e o relatório anterior.

Como interpretar o resultado

O nome, o modelo e o idioma do conjunto de tarefas, além dos títulos e prompts, são armazenados localmente para reutilização. A reavaliação inicia uma execução limpa, preservando as entradas pretendidas do teste.

O que isso não pode comprovar

Os conjuntos de tarefas salvos existem apenas neste dispositivo e não são sincronizados nem incluídos em backups. Respostas, escolhas de modelos, revisões, relatórios e chaves de API não são salvos em um conjunto de tarefas. Limpar os dados do site pode remover todos os conjuntos salvos.

Pergunta frequente: O que muda quando escolho Reavaliar?

O OpenGPT mantém as mesmas tarefas e versões exatas dos modelos e depois limpa as respostas, pontuações e avaliações anteriores, o estado de revelação e o relatório, para que a próxima execução seja independente do resultado antigo.

Voltar ao topo
13

Relatório de decisão compartilhável

Crie um link que preserve a privacidade para uma lista de modelos oficiais e sua data-limite de dados públicos.

Aberto

Para que serve este recurso

Use o relatório para compartilhar qual tarefa e quais versões oficiais exatas estão sendo consideradas, as evidências públicas disponíveis e um candidato selecionado opcional.

Antes de começar

Crie o relatório a partir de um ranking por tarefa. Confirme a tarefa, os IDs exatos dos modelos, a data-limite dos dados e a escolha opcional antes de compartilhar.

Tutorial passo a passo

  1. 1Abra um ranking por tarefa e crie um relatório com dois ou três candidatos oficiais.
  2. 2Opcionalmente, marque um modelo como selecionado; também é válido deixar a escolha em branco.
  3. 3Revise a cobertura dos dados públicos e os limites do relatório.
  4. 4Copie o link, use a folha de compartilhamento do dispositivo, imprima-o ou baixe o registro JSON sanitizado.
  5. 5Um destinatário pode abrir a mesma lista de finalistas, comparar dados públicos ou iniciar uma avaliação com tarefas reais.

Como interpretar o resultado

A URL compartilhada contém apenas o ID da tarefa, os IDs oficiais exatos dos modelos, a data-limite dos dados públicos e um modelo selecionado opcional, permitindo que o destinatário examine a mesma pré-seleção.

O que isso não pode comprovar

O relatório compartilhável não contém prompts, respostas de modelos, anotações, chaves de API nem o relatório de avaliação completo. Ele é um registro da pré-seleção, não a comprovação de um vencedor universal ou de uma saída autenticada do provedor.

Pergunta frequente: Alguém consegue ver o conteúdo da minha avaliação pelo link compartilhado?

Não. Prompts, respostas, observações, chaves de API e o projeto local de avaliação são excluídos. Sempre examine o link antes de compartilhá-lo se você tiver acrescentado informações fora do fluxo de relatórios compatível.

Voltar ao topo
14

Verificação do relatório

Verificar a estrutura e a consistência interna dos relatórios JSON compatíveis, além de padrões que possam indicar segredos e uma impressão digital local.

Aberto

Para que serve este recurso

Use o verificador para examinar um pacote OpenGPT Evidence v1 ou v2 ou um relatório V3 baixado do Espaço de Decisões. Todas as verificações são executadas localmente neste navegador.

Antes de começar

Obtenha o arquivo JSON original. Para um relatório de comparação, baixe-o no Espaço de Decisões; primeiro conclua todos os casos se precisar de um resultado concluído em vez de um rascunho.

Tutorial passo a passo

  1. 1Escolha o arquivo JSON; ele permanecerá neste navegador.
  2. 2Confirme que o verificador reconhece Evidence v1/v2, a comparação privada v1/v2 do OpenGPT ou Espaço de Decisões v3.
  3. 3Em pacotes de evidências, revise os campos obrigatórios, as execuções, os carimbos de data e hora, as pontuações e as verificações de segurança contra segredos. Em relatórios de comparação, revise os nomes dos candidatos, a suíte de tarefas, o status de rascunho ou conclusão, os casos exclusivos e se o resumo corresponde aos veredictos registrados.
  4. 4Leia o resumo declarado e salve a impressão digital SHA-256 se precisar confirmar mais tarde que exatamente o mesmo arquivo foi revisado.
  5. 5Se uma verificação falhar, corrija os dados de origem ou conclua os casos de comparação ausentes, em vez de editar o relatório baixado para forçar uma aprovação.

Como interpretar o resultado

No Evidence v1/v2, Passed significa que o pacote segue as regras compatíveis de estrutura e consistência, enquanto Demo identifica um exemplo. Em um relatório de comparação, Passed significa que um relatório concluído é internamente consistente; Draft significa que a estrutura é válida, mas a comparação não foi concluída. Failed significa que pelo menos uma verificação obrigatória precisa ser revisada.

O que isso não pode comprovar

Uma aprovação não comprova que o modelo indicado produziu as respostas coladas, que as alegações do provedor são verdadeiras ou que o resultado se aplica além dos testes registrados. Resultados de arquivos sem relação não são automaticamente comparáveis.

Pergunta frequente: Um relatório de comparação aprovado comprova que um modelo é melhor?

Não. Isso confirma apenas que o relatório compatível tem estrutura válida e consistência interna. Você ainda precisa avaliar a identidade do modelo, a qualidade dos testes, os resultados e a relevância para a decisão.

Voltar ao topo
15

Metodologia da avaliação

Saiba o que torna uma decisão sobre modelos inspecionável e reproduzível.

Aberto

Para que serve este recurso

Use esta página antes de criar, publicar ou confiar em uma avaliação. Ela separa a qualidade das evidências da popularidade do modelo.

Antes de começar

Comece com uma pergunta de decisão concreta, versões de modelos identificadas, tarefas representativas e um plano para preservar as saídas brutas.

Tutorial passo a passo

  1. 1Registre a decisão e os critérios de sucesso antes de ver os resultados.
  2. 2Use o mesmo conjunto de tarefas, as mesmas configurações e as mesmas regras de pontuação para todos os candidatos.
  3. 3Preserve prompts, saídas, configurações, falhas, carimbos de data e hora e impressões digitais dos conjuntos de testes.
  4. 4Declare o que foi manual, automatizado, revisado com nomes de modelos ocultos, aleatorizado ou reproduzido de forma independente.
  5. 5Publique as conclusões com a incerteza e as limitações explícitas.

Como interpretar o resultado

O Evidence v1/v2 verifica principalmente o formato e as declarações. O Espaço de Decisões V3 permite recálculo local (L3); a reprodução independente no L4 continua sem suporte.

O que isso não pode comprovar

Um processo rigoroso pode reduzir vieses, mas não garante que uma amostra represente todos os usuários, idiomas, versões futuras ou condições de produção.

Pergunta frequente: Um nível mais alto de evidência é sempre necessário?

Ajuste o rigor às consequências. Um teste pessoal talvez precise apenas de L1; uma alegação pública ou de alto impacto deve buscar evidências independentes mais robustas.

Voltar ao topo

Glossário em linguagem simples

Use estas definições quando um rótulo não for conhecido.

Registro da fonte
Uma linha preservada de um ranking publicado, com o ID ou nome de modelo da fonte mantido exatamente para revisão e auditoria.
ID oficial do modelo
Um identificador de modelo documentado pelo provedor que a OpenGPT mantém separado do nome do registro de origem.
Versão do catálogo
Uma versão de modelo listada a partir da documentação do provedor, com seu destino oficial e sua fonte de revisão.
Faixa de pontuação provável
Um intervalo de incerteza publicado em torno da pontuação exibida. Intervalos mais amplos indicam menor precisão; intervalos de diferentes fontes de ranking não são diretamente comparáveis.
Meus Modelos
Uma lista de finalistas armazenada apenas neste navegador. Ela não é uma conta, sincronização em nuvem nem favorito do provedor.
Adequação ao requisito
Uma etiqueta qualitativa de adequação da família, acompanhada do número de requisitos atendidos; nenhuma delas avalia versões individuais. Verifique a disponibilidade e compare versões exatas nas mesmas tarefas.
Família de modelos
Um grupo de versões de modelos relacionadas. Capacidades, preços e acesso podem variar entre versões.
Benchmark
Um conjunto repetível de tarefas e uma regra de pontuação usados para comparar sistemas nas condições declaradas.
Configuração de Agent
O modelo-base, a estrutura, as ferramentas, as permissões, o orçamento, o ambiente, a versão do benchmark e a data que produziram um resultado de Agente.
Classificação das evidências
Uma etiqueta que descreve como um resultado foi produzido ou verificado. Ela não altera a pontuação de origem.
Custo por êxito
Custo da avaliação informado dividido pelas tarefas bem-sucedidas. Ele só é exibido quando existem dados comparáveis da fonte; a ausência do custo não representa zero.
Arquivo de evidências
Um registro estruturado que declara como uma avaliação foi executada e o que ela observou.
Esquema
As regras legíveis por máquina que definem os campos obrigatórios e os valores permitidos em um arquivo.
Impressão digital SHA-256
Um identificador local dos bytes exatos de um arquivo; alterar o arquivo altera a impressão digital.

Solução de problemas

Nenhum modelo atende a todos os requisitos

Revise qual requisito excluiu cada candidato e flexibilize apenas uma restrição que seja realmente flexível.

Revisar requisitos

Um número de posição da fonte é omitido

O publicador pode usar posições empatadas ou várias configurações. O OpenGPT preserva a posição original em vez de renumerar as linhas visíveis.

Revisar a classificação

Um resultado de Agent não tem dados de custo ou confiabilidade

A fonte não publicou um valor comparável. O OpenGPT o deixa sem informação em vez de tratá-lo como zero; compare apenas valores do mesmo escopo de benchmark.

Revisar evidências de Agentes

Uma linha não tem um ID oficial de modelo

É um registro completo da fonte, não um status não resolvido. Abra a fonte original; use o diretório de modelos quando precisar de identidade documentada pelo provedor e acesso oficial.

Revisar identidade da fonte

Meus Modelos está vazio ou desapareceu

Use o mesmo perfil de navegador e dispositivo. O modo privado, o bloqueio do armazenamento ou a limpeza dos dados do site podem remover a lista local.

Abrir Meus Modelos

Não é possível adicionar um registro à comparação de dados

A comparação de dados aceita IDs de modelos do catálogo. O mesmo modelo talvez já esteja selecionado ou a lista pode ter atingido o limite de quatro modelos. Escolha outra versão do catálogo ou remova primeiro um candidato.

Abrir o diretório de modelos

O teste do Proof Lab está incompleto

Volte ao teste e conclua toda saída obrigatória de configuração e tarefa, o status da revisão, a verificação de falhas críticas e o resultado confirmado pelo usuário.

Continuar no Laboratório de Provas

Um rascunho local está em conflito ou precisa ser redefinido

Volte a Comparar, revise o aviso sobre o rascunho local mais recente e decida explicitamente se deseja mantê-lo ou redefini-lo.

Revisar rascunho local

Um arquivo de evidência falha

Use o item reprovado na lista de verificação para corrigir o registro de origem. Não insira segredos nem reescreva resultados.

Abrir verificador
contact@opengpt.com

Ainda precisa de ajuda?

Informe um link quebrado, um detalhe incorreto de modelo ou um problema que você não conseguiu resolver.

Suporte por e-mail