INVESTIGACIÓN DE OpenGPT

Índice de evidencia de modelos y agentes de AI

Usa este índice para pasar de una fuente de origen o un proveedor a un registro exacto de modelo, producto Agent o benchmark. Cada destino indica qué abarca su evidencia y qué no puede demostrar.

Fuentes de clasificaciones públicas
2
Proveedores de modelos
11
Familias de modelos
13
Agent categories · Agent benchmarks
7 · 9

Alcance de la evidencia

Esta página es un índice de evidencias públicas existentes e identidades documentadas por proveedores. La inclusión no implica el respaldo de OpenGPT ni una posición universal.

How OpenGPT handles this evidence

El índice se genera a partir del mismo catálogo de modelos revisado, las instantáneas de clasificaciones públicas, el directorio propio de identidad de Agents y los registros de benchmark utilizados en las clasificaciones visibles.

Límites de la comparación

  • Las distintas fuentes miden objetos diferentes y no deben fusionarse en una única puntuación universal.
  • Hay que comprobar las fechas, las versiones y la identidad de la configuración antes de actuar a partir de un resultado.
  • OpenGPT organiza pruebas públicas; no afirma haber repetido todas las evaluaciones incluidas.

Explorar centros de evidencia

Explora las fuentes de clasificaciones públicas de OpenGPT, los proveedores verificados, las familias de modelos, las categorías de Agents y los alcances de los benchmarks desde un único índice de investigación rastreable.

  1. LMArenaFuentes de clasificaciones públicasText Style Control
  2. LiveBenchFuentes de clasificaciones públicasLiveBench-2026-06-25
  3. OpenAIProveedores de modelos7 Official model IDs
  4. AnthropicProveedores de modelos6 Official model IDs
  5. GoogleProveedores de modelos12 Official model IDs
  6. MetaProveedores de modelos5 Official model IDs
  7. DeepSeekProveedores de modelos2 Official model IDs
  8. Alibaba QwenProveedores de modelos12 Official model IDs
  9. Mistral AIProveedores de modelos6 Official model IDs
  10. xAIProveedores de modelos5 Official model IDs
  11. CohereProveedores de modelos8 Official model IDs
  12. MicrosoftProveedores de modelos5 Official model IDs
  13. Moonshot AIProveedores de modelos11 Official model IDs
  14. GPTFamilias de modelos7 Official model IDs
  15. CLAUDEFamilias de modelos6 Official model IDs
  16. GEMINIFamilias de modelos7 Official model IDs
  17. LLAMAFamilias de modelos3 Official model IDs
  18. MUSEFamilias de modelos2 Official model IDs
  19. DEEPSEEKFamilias de modelos2 Official model IDs
  20. QWENFamilias de modelos12 Official model IDs
  21. MISTRALFamilias de modelos6 Official model IDs
  22. GROKFamilias de modelos5 Official model IDs
  23. CommandFamilias de modelos8 Official model IDs
  24. GEMMAFamilias de modelos5 Official model IDs
  25. PHIFamilias de modelos5 Official model IDs
  26. KIMIFamilias de modelos11 Official model IDs
  27. ProgramaciónCategorías de Agents21 Verified products
  28. Terminal y DevOpsCategorías de Agents7 Verified products
  29. NavegadorCategorías de Agents7 Verified products
  30. Uso del ordenadorCategorías de Agents6 Verified products
  31. Herramientas y APIsCategorías de Agents7 Verified products
  32. InvestigaciónCategorías de Agents9 Verified products
  33. Flujo de trabajo empresarialCategorías de Agents9 Verified products
  34. SWE-bench VerifiedBenchmarks de AgentsVerified · Top 10 published configurations · 500 tareas
  35. Terminal-Bench 2.1Benchmarks de Agentsterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  36. AssistantBenchBenchmarks de AgentsInstantánea verificada de HAL · 33 tareas públicas · 1 entorno
  37. WebArenaBenchmarks de Agentsv0.2.0 · canonical self-hosted environment
  38. OSWorld 2.0Benchmarks de Agentstask version v2026.06.24 · 500-step budget
  39. Berkeley Function-Calling LeaderboardBenchmarks de AgentsBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  40. GAIABenchmarks de AgentsHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  41. τ²-bench CoreBenchmarks de Agentsv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  42. τ³-Banking KnowledgeBenchmarks de Agentsv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials