METODOLOGIA DO ESPAÇO DE TRABALHO PARA DECISÕES DE IA

Veja como uma recomendação se transforma em decisão.

O OpenGPT é um espaço de trabalho para decisões de IA. Ele mantém separados a correspondência editorial dos requisitos, os registros factuais das fontes, a avaliação em tarefas reais e as evidências publicadas de benchmarks, para que cada resultado mostre suas condições e limites.

O método em um minuto

  • Uma posição é relativa a uma fonte e um escopo específicos, não uma pontuação universal.
  • Versões exatas de modelos e configurações completas de Agentes são a unidade de comparação.
  • Dados desconhecidos ou incompatíveis permanecem desconhecidos, em vez de serem convertidos em zero ou em uma classificação combinada.
  • As verificações de relatórios locais comprovam a estrutura e a consistência interna, não a origem dos resultados nem a autenticidade do provedor.

Pontuações de adequação editorial · editorial-fit-v1

Como são atribuídas as pontuações editoriais de adequação de 0 a 10

Estes oito sinais do catálogo permitem comparação por categoria. Eles formam uma camada documentada de julgamento editorial do OpenGPT, separada dos pontos de recomendação do rules-v2 e das evidências de benchmarks públicos.

Pontuação editorial de adequação do produto: 10 indica maior adequação à dimensão indicada; as dimensões são exibidas igualmente e nunca combinadas para definir um vencedor geral.

Inteligência

0–10

Adequação editorial a trabalhos gerais amplos e complexos usando recursos documentados, a função no catálogo e limitações conhecidas do produto, não uma pontuação de QI nem de benchmark.

Programação

0–10

Adequação editorial a planejamento, implementação, depuração e revisão de software, além de fluxos em repositórios; não é uma taxa de aprovação medida.

Raciocínio

0–10

Adequação editorial à análise em várias etapas, ao tratamento de restrições e à resolução estruturada de problemas, não um benchmark de raciocínio reproduzido.

Redação

0–10

Adequação editorial a fluxos de elaboração, edição, textos longos e documentação, não um resultado medido de estilo ou exatidão factual.

Velocidade

0–10

Adequação editorial a iterações ágeis com base no posicionamento do produto e no modo de disponibilização, não uma alegação de latência medida.

Eficiência de custos

0–10

Adequação editorial ao controle do preço de acesso e do custo operacional usando os níveis informados e o modo de implantação; não é um cálculo do custo total nem uma garantia de preço.

Controle de privacidade

0–10

Adequação editorial ao controle da implantação e dos dados usando a classificação local, híbrida ou em nuvem; não é uma auditoria de segurança, conformidade nem telemetria.

Ecossistema

0–10

Adequação editorial às ferramentas, integrações, plataformas e opções de implantação disponíveis, não uma medição de participação de mercado nem da qualidade das integrações.

Pesos e agregação

Cada dimensão recebe o mesmo destaque visual. Não há peso aritmético, média, pontuação total nem vencedor geral; o usuário decide quais dimensões importam para as condições informadas.

Limite da avaliação humana

Os editores atribuem sinais inteiros de adequação de 0 a 10 com base na rubrica, nos fatos sobre o produto confirmados pelo provedor e nas classificações do catálogo. A pontuação não é uma medição da versão exata, um resultado de benchmark, uma probabilidade nem uma garantia do provedor.

Fontes

As páginas oficiais dos provedores sustentam a identidade, o acesso, os recursos publicados, as opções de implantação e os preços informados. As etiquetas de melhor uso, os pontos fortes e fracos, as classificações e todos os valores de 0 a 10 do OpenGPT são critérios editoriais.

Revisão do catálogo

Última revisão do catálogo:

Confiança: Cobertura editorial média

A confiança descreve a completude da cobertura do catálogo e da explicação, não a probabilidade de um bom desempenho. As informações dos provedores podem mudar, e o sinal de adequação não foi medido de forma independente.

Aplicabilidade

Use as pontuações para comparar entradas do catálogo pela dimensão indicada, considerando as premissas atuais de produto e implantação. Não interprete diferenças de pontuação como diferenças de desempenho medidas.

Antes da adoção, verifique as informações atuais do provedor e teste a versão exata do modelo, o nível de serviço, as ferramentas, a região e um trabalho representativo.

Método publicado · rules-v2

Como as recomendações do OpenGPT são produzidas

O Construtor transforma um Perfil local em uma pré-seleção determinística. Os pontos abaixo classificam a adequação editorial do produto após os critérios obrigatórios de orçamento e privacidade; eles não medem a qualidade do modelo.

Dimensões de pontuação e pontos das regras aditivas

Os pontos são pesos condicionais, não porcentagens. Um critério obrigatório elimina um item inelegível antes da pontuação.

Adequação à tarefa e ao objetivo

Model · Tool

Os modelos recebem +12 por correspondência com cada tarefa selecionada e +10 por correspondência exata com o objetivo. As ferramentas recebem +10 por correspondência com cada caso de uso selecionado.

User-declared conditions · OpenGPT editorial catalog

Privacidade e implantação

Model · Tool

A privacidade alta exclui modelos não locais e ferramentas que não tenham classificação de alta privacidade. Modelos locais elegíveis recebem +30, e ferramentas de alta privacidade recebem +12. Para privacidade média, modelos híbridos/locais/em nuvem recebem +8/+5/+2.

User-declared conditions · OpenGPT editorial catalog

Elegibilidade pelo orçamento

Model · Tool

Itens fora da faixa de preço informado selecionada são excluídos. Modelos elegíveis recebem +12, e ferramentas recebem +8; um modelo de perfil gratuito com uma opção gratuita informada recebe mais +16.

User-declared conditions · Provider-published facts · OpenGPT editorial catalog

Adequação à função profissional

Model · Tool

Correspondências entre estudante e modelo recebem +10; outras correspondências compatíveis de função do modelo, +8. Correspondências entre estudante e ferramenta recebem +8; outras correspondências compatíveis de função da ferramenta, +6.

User-declared conditions · OpenGPT editorial catalog

Sinais do setor

Model · Tool

Os termos reconhecidos do setor são mapeados para categorias de tarefas. Os modelos recebem +5 e as ferramentas, +4 para cada tarefa mapeada que corresponda. O texto livre em si não é copiado para o fluxo de trabalho.

User-declared conditions · OpenGPT editorial catalog

Adequação ao idioma

Modelo

Para uma preferência que não seja inglês, um modelo multilíngue correspondente no catálogo recebe +14, enquanto um que não corresponde recebe −3. Para inglês, a adequação à redação ou documentação recebe +3.

User-declared conditions · OpenGPT editorial catalog

Adequação à plataforma

Model · Tool

As correspondências do modelo pontuam Web +3, Desktop +10, Terminal +8, API +7 e Mobile +9. As ferramentas recebem +7 por plataforma correspondente ou −3 quando nenhuma corresponde.

User-declared conditions · OpenGPT editorial catalog

Adequação à experiência

Model · Tool

A adequação do modelo para iniciantes vale +10 (ou −4 em caso de incompatibilidade com um modelo local), para usuários avançados vale +7 e, para usuários intermediários com modelos de fronteira ou híbridos, vale +2. A adequação das ferramentas para iniciantes/avançados vale +6/+5.

User-declared conditions · OpenGPT editorial catalog

Seleção e empates

Model · Tool

Os candidatos elegíveis são ordenados pelos pontos das regras; empates usam a ordem dos nomes. As funções são preenchidas em uma sequência fixa, e até três modelos correspondentes restantes se tornam alternativas.

Regras determinísticas rules-v2

Fontes e limites das afirmações

Fonte factual

Fatos publicados pelo provedor

As páginas oficiais dos provedores sustentam a identidade, o acesso, as descrições publicadas dos recursos e os preços informados. O OpenGPT não trata essas páginas como testes independentes de desempenho.

Avaliação editorial

Catálogo editorial do OpenGPT

As etiquetas de melhor uso, os pontos fortes, as classificações de privacidade/implantação e os sinais de adequação do produto são avaliações editoriais revisadas. Não são medições de benchmark nem garantias dos provedores.

Condição declarada pelo usuário

Condições declaradas pelo usuário

Objetivo, tarefas, função, orçamento, privacidade, idioma, plataforma, habilidade e sinais do setor vêm do perfil local do usuário. Eles descrevem aplicabilidade, não evidências externas.

Regra mecânica

Regras determinísticas rules-v2

O mesmo perfil normalizado e instantâneo do catálogo produzem a mesma ordem. A aritmética é explicável, mas o determinismo não transforma entradas editoriais em fatos.

Somente contexto

Contexto de benchmark público

As classificações públicas continuam sendo evidências separadas. O rules-v2 não adiciona posições nem pontuações de benchmarks aos pontos de recomendação; use-as após a pré-seleção e preserve o escopo de cada fonte.

Factual em comparação com editorial

Fonte factual

As alegações factuais devem remeter a um provedor ou uma fonte de benchmark identificados, uma identidade exata quando disponível e uma data de revisão.

Avaliação editorial

As etiquetas de adequação, os pontos fortes, as classificações, as premissas, a confiança e as recomendações são avaliações editoriais do OpenGPT. Elas não podem ser apresentadas como resultados medidos de uma versão exata.

Periodicidade e confiança da revisão

A metodologia e os registros de recomendações ativas têm revisão programada pelo menos a cada 90 dias, além das revisões motivadas por eventos. Cada resultado deve usar a data de revisão do próprio registro, não a data desta página.

A revisão é acionada quando

  • Um provedor altera um ID de modelo, ciclo de vida, caminho de acesso, declaração de capacidade ou preço informado.
  • O mecanismo de recomendação, os pesos, os critérios obrigatórios ou a taxonomia editorial muda.
  • Uma correção identifica um erro relevante de fonte, identidade, preço, privacidade ou aplicabilidade.

Regras de confiança

A confiança descreve a completude da explicação de adequação e do registro que a fundamenta. Ela não representa uma probabilidade de que o modelo terá bom desempenho.

Alta
A identidade exata e uma fonte factual atual estão presentes; os campos relevantes foram resolvidos, as premissas estão visíveis e uma alternativa qualificada foi indicada.
Médio
A correspondência é explicável, mas uma fonte, condição ou fato atual precisa ser confirmado antes da adoção.
Baixa
Há uma lacuna relevante na identidade, atualidade, definição de preços, privacidade ou aplicabilidade. Trate o item somente como um candidato a investigar.

Aplicabilidade e condições

  • Aplica-se à lista editorial rules-v2 gerada com base no catálogo atual e revisado de modelos e ferramentas.
  • O resultado depende do perfil enviado e do instantâneo do catálogo; se um deles mudar, o resultado também poderá mudar.
  • É um recurso de apoio para decisões de baixo impacto, não uma comprovação de qualidade, preço em tempo real, liderança em benchmarks, segurança, legalidade nem adequação a uso regulamentado.

Exibição obrigatória da auditoria por resultado

Uma recomendação integrada deve apresentar todos os sete campos abaixo sem exigir que o usuário deduza o limite da evidência.

  1. Por quê
  2. Evidência
  3. Premissas
  4. Última revisão
  5. Confiança
  6. Melhor alternativa
  7. Quando não escolher

De uma tarefa real a uma conclusão que pode ser revisada

1

Definir o teste

Antes de comparar, registre a tarefa, os critérios de sucesso, as entradas, as restrições, as versões exatas dos modelos, as configurações e a data.

2

Use as mesmas condições

Dê a todos os candidatos a mesma tarefa e rubrica. Rótulos ocultos reduzem o viés do nome visível, mas isso não constitui um teste duplo-cego nem executado de forma independente.

3

Manter os dados da fonte

Salve prompts, respostas, pontuações, erros, latência e hashes. Não preencha evidências ausentes com estimativas.

4

Declare os limites

Mostre a incerteza, o tamanho da amostra, as exclusões, os conflitos e o que o resultado não comprova.

Níveis de evidência

O Evidence v1/v2 verifica o formato do arquivo e a consistência declarada. O Espaço de Decisões V3 também recalcula hashes, atribuições, mapeamentos, pontuações e resumos a partir das entradas salvas. Isso não comprova reprodução independente no L4.

L1Supported now

Formato verificado

O arquivo segue o esquema declarado e não contém campos de segredos evidentes.

L2Partially supported

Registro completo

O objetivo é um registro consistente de tarefas, configurações, declarações de modelos e data da avaliação. A V1 verifica apenas parte desse registro.

L3Supported for V3

Recalculável

O Espaço de Decisões V3 inclui os resultados brutos colados e as entradas de pontuação para um recálculo local rigoroso; o Evidence v1/v2 não contém os mesmos campos.

L4Not yet supported

Reproduzido de forma independente

Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.

Como os rankings de Agentes de IA são comparados

Cada linha representa uma configuração de Agente publicada dentro de um escopo de benchmark identificado. Ela não é uma pontuação apenas do modelo base.

Comparar configurações de sistemas

Mantenha juntos todos os campos de Agente, modelo base, estrutura, ferramenta, ambiente, orçamento e data publicados pela fonte; marque os campos não informados como desconhecidos.

Preservar as escalas originais

Classifique apenas dentro do mesmo benchmark, versão, regras de tarefa e grupo de execuções comparáveis. O OpenGPT não cria uma pontuação universal entre benchmarks.

Informe o status das evidências

Diferencie registros listados por um publicador de benchmarks, submissões verificadas na origem, relatórios de provedores e execuções da comunidade.

Manter evidências operacionais

Mostre custo, latência, etapas e intervenção humana quando a fonte fornecer valores comparáveis; mantenha os valores ausentes como desconhecidos.

O que a validação local pode estabelecer

  • Campos obrigatórios e tipos de dados compatíveis
  • Consistência interna de pontuações, execuções, datas e hashes
  • Se o pacote declara dados de demonstração
  • Ausência de campos comuns de chaves de API e segredos

O que isso não pode estabelecer sozinho

  • Que o provedor ou modelo declarado tenha realmente produzido a saída
  • Que uma pontuação esteja livre de viés de seleção ou de um projeto de teste fraco
  • Que um resultado se aplique a todas as tarefas, idiomas, usuários ou versões futuras do modelo
  • Que um modelo seja seguro, legal ou apropriado para uma decisão de alto risco

Princípios da publicação

Sem pagamento por posição no ranking

Patrocínios podem ser informados, mas não podem alterar a pontuação, os critérios de evidência nem o posicionamento.

Versões, não nomes de marcas

Uma série de modelos não é um objeto de teste estável. IDs exatos dos modelos, configurações, região e data são importantes.

Tarefas reais antes de afirmações amplas

O OpenGPT recomenda listas de finalistas com base nos requisitos e depois solicita que os usuários testem seu próprio trabalho representativo.

A incerteza é um resultado

Empates, amostras pequenas, execuções com falha e evidências inconclusivas devem permanecer visíveis.