Índice de evidências de modelos e agentes de IA
Use este índice para partir de uma fonte original ou de um provedor e chegar a um modelo exato, produto de Agente ou registro de benchmark. Cada destino informa o que suas evidências abrangem e o que elas não podem comprovar.
- Fontes das classificações públicas
- 2
- Provedores de modelos
- 11
- Famílias de modelos
- 13
- Agent categories · Agent benchmarks
- 7 · 9
Escopo das evidências
Esta página é um índice das evidências públicas existentes e das identidades documentadas pelos provedores. A inclusão não representa endosso do OpenGPT nem posição universal.
How OpenGPT handles this evidence
O índice é gerado com base no mesmo catálogo revisado de modelos, nos instantâneos de leaderboards públicos, no diretório próprio de identidades de Agentes e nos registros de benchmarks usados nas classificações visíveis.
Limites da comparação
- Fontes diferentes medem objetos diferentes e não podem ser combinadas em uma única pontuação universal.
- As datas, versões e identidade da configuração devem ser verificadas antes de agir com base em um resultado.
- O OpenGPT organiza evidências públicas; ele não alega ter repetido todas as avaliações listadas.
Explorar centros de evidências
Explore as fontes públicas de ranking, os provedores verificados, as famílias de modelos, as categorias de agentes e os escopos de benchmark do OpenGPT em um único índice de pesquisa rastreável.
- LMArenaFontes das classificações públicasText Style Control
- LiveBenchFontes das classificações públicasLiveBench-2026-06-25
- OpenAIProvedores de modelos7 Official model IDs
- AnthropicProvedores de modelos6 Official model IDs
- GoogleProvedores de modelos12 Official model IDs
- MetaProvedores de modelos5 Official model IDs
- DeepSeekProvedores de modelos2 Official model IDs
- Alibaba QwenProvedores de modelos12 Official model IDs
- Mistral AIProvedores de modelos6 Official model IDs
- xAIProvedores de modelos5 Official model IDs
- CohereProvedores de modelos8 Official model IDs
- MicrosoftProvedores de modelos5 Official model IDs
- Moonshot AIProvedores de modelos11 Official model IDs
- GPTFamílias de modelos7 Official model IDs
- CLAUDEFamílias de modelos6 Official model IDs
- GEMINIFamílias de modelos7 Official model IDs
- LLAMAFamílias de modelos3 Official model IDs
- MUSEFamílias de modelos2 Official model IDs
- DEEPSEEKFamílias de modelos2 Official model IDs
- QWENFamílias de modelos12 Official model IDs
- MISTRALFamílias de modelos6 Official model IDs
- GROKFamílias de modelos5 Official model IDs
- CommandFamílias de modelos8 Official model IDs
- GEMMAFamílias de modelos5 Official model IDs
- PHIFamílias de modelos5 Official model IDs
- KIMIFamílias de modelos11 Official model IDs
- ProgramaçãoCategorias de Agents21 Verified products
- Terminal e DevOpsCategorias de Agents7 Verified products
- NavegadorCategorias de Agents7 Verified products
- Uso do computadorCategorias de Agents6 Verified products
- Ferramentas e APIsCategorias de Agents7 Verified products
- PesquisaCategorias de Agents9 Verified products
- Fluxo de trabalho empresarialCategorias de Agents9 Verified products
- SWE-bench VerifiedBenchmarks de AgentsVerified · Top 10 published configurations · 500 tarefas
- Terminal-Bench 2.1Benchmarks de Agentsterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchBenchmarks de AgentsInstantâneo verificado do HAL · 33 tarefas públicas · 1 estrutura
- WebArenaBenchmarks de Agentsv0.2.0 · canonical self-hosted environment
- OSWorld 2.0Benchmarks de Agentstask version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardBenchmarks de AgentsBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIABenchmarks de AgentsHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreBenchmarks de Agentsv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeBenchmarks de Agentsv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials