OpenGPT RESEARCH
AI model and agent evidence index
Use this index to move from an upstream source or provider to an exact model, Agent product, or benchmark record. Each destination states what its evidence covers and what it cannot prove.
- Public ranking sources
- 3
- Model providers
- 11
- Model families
- 13
- Agent categories · Agent benchmarks
- 7 · 9
Evidence scope
This page is an index of existing public evidence and provider-documented identities. Inclusion does not imply an OpenGPT endorsement or a universal rank.
How OpenGPT handles this evidence
The index is generated from the same reviewed model catalog, public leaderboard snapshots, first-party Agent identity directory, and benchmark records used by the visible rankings.
Comparison boundaries
- Different sources measure different objects and must not be merged into one universal score.
- Dates, versions, and configuration identity must be checked before acting on a result.
- OpenGPT organizes public evidence; it does not claim to have rerun every listed evaluation.
Browse evidence hubs
Browse OpenGPT's public ranking sources, verified providers, model families, agent categories, and benchmark scopes from one crawlable research index.
- LMArenaPublic ranking sourcesText Style Control
- Artificial AnalysisPublic ranking sourcesIntelligence Index v4.1.1
- LiveBenchPublic ranking sourcesLiveBench-2026-06-25
- OpenAIModel providers7 Official model IDs
- AnthropicModel providers6 Official model IDs
- GoogleModel providers12 Official model IDs
- MetaModel providers5 Official model IDs
- DeepSeekModel providers2 Official model IDs
- Alibaba QwenModel providers12 Official model IDs
- Mistral AIModel providers6 Official model IDs
- xAIModel providers5 Official model IDs
- CohereModel providers8 Official model IDs
- MicrosoftModel providers5 Official model IDs
- Moonshot AIModel providers11 Official model IDs
- GPTModel families7 Official model IDs
- CLAUDEModel families6 Official model IDs
- GEMINIModel families7 Official model IDs
- LLAMAModel families3 Official model IDs
- MUSEModel families2 Official model IDs
- DEEPSEEKModel families2 Official model IDs
- QWENModel families12 Official model IDs
- MISTRALModel families6 Official model IDs
- GROKModel families5 Official model IDs
- CommandModel families8 Official model IDs
- GEMMAModel families5 Official model IDs
- PHIModel families5 Official model IDs
- KIMIModel families11 Official model IDs
- CodingAgent categories21 Verified products
- Terminal and DevOpsAgent categories7 Verified products
- BrowserAgent categories7 Verified products
- Computer useAgent categories6 Verified products
- Tools and APIsAgent categories7 Verified products
- ResearchAgent categories9 Verified products
- Business workflowAgent categories9 Verified products
- SWE-bench VerifiedAgent benchmarksVerified · Top 10 published configurations · 500 tasks
- Terminal-Bench 2.1Agent benchmarksterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchAgent benchmarksHAL verified snapshot · 33 public tasks · 1 scaffold
- WebArenaAgent benchmarksv0.2.0 · canonical self-hosted environment
- OSWorld 2.0Agent benchmarkstask version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardAgent benchmarksBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIAAgent benchmarksHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreAgent benchmarksv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeAgent benchmarksv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials