PESQUISA DO OPENGPT

Índice de evidências de modelos e agentes de IA

Use este índice para partir de uma fonte original ou de um provedor e chegar a um modelo exato, produto de Agente ou registro de benchmark. Cada destino informa o que suas evidências abrangem e o que elas não podem comprovar.

Fontes das classificações públicas
2
Provedores de modelos
11
Famílias de modelos
13
Agent categories · Agent benchmarks
7 · 9

Escopo das evidências

Esta página é um índice das evidências públicas existentes e das identidades documentadas pelos provedores. A inclusão não representa endosso do OpenGPT nem posição universal.

How OpenGPT handles this evidence

O índice é gerado com base no mesmo catálogo revisado de modelos, nos instantâneos de leaderboards públicos, no diretório próprio de identidades de Agentes e nos registros de benchmarks usados nas classificações visíveis.

Limites da comparação

  • Fontes diferentes medem objetos diferentes e não podem ser combinadas em uma única pontuação universal.
  • As datas, versões e identidade da configuração devem ser verificadas antes de agir com base em um resultado.
  • O OpenGPT organiza evidências públicas; ele não alega ter repetido todas as avaliações listadas.

Explorar centros de evidências

Explore as fontes públicas de ranking, os provedores verificados, as famílias de modelos, as categorias de agentes e os escopos de benchmark do OpenGPT em um único índice de pesquisa rastreável.

  1. LMArenaFontes das classificações públicasText Style Control
  2. LiveBenchFontes das classificações públicasLiveBench-2026-06-25
  3. OpenAIProvedores de modelos7 Official model IDs
  4. AnthropicProvedores de modelos6 Official model IDs
  5. GoogleProvedores de modelos12 Official model IDs
  6. MetaProvedores de modelos5 Official model IDs
  7. DeepSeekProvedores de modelos2 Official model IDs
  8. Alibaba QwenProvedores de modelos12 Official model IDs
  9. Mistral AIProvedores de modelos6 Official model IDs
  10. xAIProvedores de modelos5 Official model IDs
  11. CohereProvedores de modelos8 Official model IDs
  12. MicrosoftProvedores de modelos5 Official model IDs
  13. Moonshot AIProvedores de modelos11 Official model IDs
  14. GPTFamílias de modelos7 Official model IDs
  15. CLAUDEFamílias de modelos6 Official model IDs
  16. GEMINIFamílias de modelos7 Official model IDs
  17. LLAMAFamílias de modelos3 Official model IDs
  18. MUSEFamílias de modelos2 Official model IDs
  19. DEEPSEEKFamílias de modelos2 Official model IDs
  20. QWENFamílias de modelos12 Official model IDs
  21. MISTRALFamílias de modelos6 Official model IDs
  22. GROKFamílias de modelos5 Official model IDs
  23. CommandFamílias de modelos8 Official model IDs
  24. GEMMAFamílias de modelos5 Official model IDs
  25. PHIFamílias de modelos5 Official model IDs
  26. KIMIFamílias de modelos11 Official model IDs
  27. ProgramaçãoCategorias de Agents21 Verified products
  28. Terminal e DevOpsCategorias de Agents7 Verified products
  29. NavegadorCategorias de Agents7 Verified products
  30. Uso do computadorCategorias de Agents6 Verified products
  31. Ferramentas e APIsCategorias de Agents7 Verified products
  32. PesquisaCategorias de Agents9 Verified products
  33. Fluxo de trabalho empresarialCategorias de Agents9 Verified products
  34. SWE-bench VerifiedBenchmarks de AgentsVerified · Top 10 published configurations · 500 tarefas
  35. Terminal-Bench 2.1Benchmarks de Agentsterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  36. AssistantBenchBenchmarks de AgentsInstantâneo verificado do HAL · 33 tarefas públicas · 1 estrutura
  37. WebArenaBenchmarks de Agentsv0.2.0 · canonical self-hosted environment
  38. OSWorld 2.0Benchmarks de Agentstask version v2026.06.24 · 500-step budget
  39. Berkeley Function-Calling LeaderboardBenchmarks de AgentsBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  40. GAIABenchmarks de AgentsHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  41. τ²-bench CoreBenchmarks de Agentsv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  42. τ³-Banking KnowledgeBenchmarks de Agentsv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials