Trabalho cotidiano
Redação, análise, planejamento e tarefas administrativas variadas.
- Por que estes candidatos
- Assumption · Historical. Comece com modelos amplamente capazes que tenham evidências públicas atuais de preferência e depois teste-os em seus trabalhos recorrentes.
- O que permanece incerto
- Um ranking de preferência geral não pode prever a precisão em um fluxo de trabalho especializado.
Três versões oficiais para testar primeiro
Os dados públicos delimitam as opções. Eles não substituem um teste controlado no seu próprio trabalho. Selecione dois ou três candidatos para comparar dados públicos lado a lado.
Unknown · Not automatically certified
No momento, nenhum resultado público comparável está mapeado para esta versão exata.
Evidência públicaOs modelos usam escalas diferentes de evidências públicas. Evidências ausentes não são tratadas como zero, e o OpenGPT não combina fontes distintas em uma só pontuação.+
Um ponto de partida prático, não um vencedor universalSelecione dois ou três candidatos para comparar dados públicos lado a lado.+
Os modelos usam escalas diferentes de evidências públicas. Evidências ausentes não são tratadas como zero, e o OpenGPT não combina fontes distintas em uma só pontuação.
Um ranking de preferência geral não pode prever a precisão em um fluxo de trabalho especializado.
A avaliação é aberta com este modelo de tarefa e os dois primeiros modelos selecionados. Você pode editar todas as tarefas antes de coletar respostas.