Índice de evidencia de modelos y agentes de AI
Usa este índice para pasar de una fuente de origen o un proveedor a un registro exacto de modelo, producto Agent o benchmark. Cada destino indica qué abarca su evidencia y qué no puede demostrar.
- Fuentes de clasificaciones públicas
- 2
- Proveedores de modelos
- 11
- Familias de modelos
- 13
- Agent categories · Agent benchmarks
- 7 · 9
Alcance de la evidencia
Esta página es un índice de evidencias públicas existentes e identidades documentadas por proveedores. La inclusión no implica el respaldo de OpenGPT ni una posición universal.
How OpenGPT handles this evidence
El índice se genera a partir del mismo catálogo de modelos revisado, las instantáneas de clasificaciones públicas, el directorio propio de identidad de Agents y los registros de benchmark utilizados en las clasificaciones visibles.
Límites de la comparación
- Las distintas fuentes miden objetos diferentes y no deben fusionarse en una única puntuación universal.
- Hay que comprobar las fechas, las versiones y la identidad de la configuración antes de actuar a partir de un resultado.
- OpenGPT organiza pruebas públicas; no afirma haber repetido todas las evaluaciones incluidas.
Explorar centros de evidencia
Explora las fuentes de clasificaciones públicas de OpenGPT, los proveedores verificados, las familias de modelos, las categorías de Agents y los alcances de los benchmarks desde un único índice de investigación rastreable.
- LMArenaFuentes de clasificaciones públicasText Style Control
- LiveBenchFuentes de clasificaciones públicasLiveBench-2026-06-25
- OpenAIProveedores de modelos7 Official model IDs
- AnthropicProveedores de modelos6 Official model IDs
- GoogleProveedores de modelos12 Official model IDs
- MetaProveedores de modelos5 Official model IDs
- DeepSeekProveedores de modelos2 Official model IDs
- Alibaba QwenProveedores de modelos12 Official model IDs
- Mistral AIProveedores de modelos6 Official model IDs
- xAIProveedores de modelos5 Official model IDs
- CohereProveedores de modelos8 Official model IDs
- MicrosoftProveedores de modelos5 Official model IDs
- Moonshot AIProveedores de modelos11 Official model IDs
- GPTFamilias de modelos7 Official model IDs
- CLAUDEFamilias de modelos6 Official model IDs
- GEMINIFamilias de modelos7 Official model IDs
- LLAMAFamilias de modelos3 Official model IDs
- MUSEFamilias de modelos2 Official model IDs
- DEEPSEEKFamilias de modelos2 Official model IDs
- QWENFamilias de modelos12 Official model IDs
- MISTRALFamilias de modelos6 Official model IDs
- GROKFamilias de modelos5 Official model IDs
- CommandFamilias de modelos8 Official model IDs
- GEMMAFamilias de modelos5 Official model IDs
- PHIFamilias de modelos5 Official model IDs
- KIMIFamilias de modelos11 Official model IDs
- ProgramaciónCategorías de Agents21 Verified products
- Terminal y DevOpsCategorías de Agents7 Verified products
- NavegadorCategorías de Agents7 Verified products
- Uso del ordenadorCategorías de Agents6 Verified products
- Herramientas y APIsCategorías de Agents7 Verified products
- InvestigaciónCategorías de Agents9 Verified products
- Flujo de trabajo empresarialCategorías de Agents9 Verified products
- SWE-bench VerifiedBenchmarks de AgentsVerified · Top 10 published configurations · 500 tareas
- Terminal-Bench 2.1Benchmarks de Agentsterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchBenchmarks de AgentsInstantánea verificada de HAL · 33 tareas públicas · 1 entorno
- WebArenaBenchmarks de Agentsv0.2.0 · canonical self-hosted environment
- OSWorld 2.0Benchmarks de Agentstask version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardBenchmarks de AgentsBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIABenchmarks de AgentsHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreBenchmarks de Agentsv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeBenchmarks de Agentsv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials