OpenGPT RESEARCH

AI model and agent evidence index

Use this index to move from an upstream source or provider to an exact model, Agent product, or benchmark record. Each destination states what its evidence covers and what it cannot prove.

Public ranking sources
3
Model providers
11
Model families
13
Agent categories · Agent benchmarks
7 · 9

Evidence scope

This page is an index of existing public evidence and provider-documented identities. Inclusion does not imply an OpenGPT endorsement or a universal rank.

How OpenGPT handles this evidence

The index is generated from the same reviewed model catalog, public leaderboard snapshots, first-party Agent identity directory, and benchmark records used by the visible rankings.

Comparison boundaries

  • Different sources measure different objects and must not be merged into one universal score.
  • Dates, versions, and configuration identity must be checked before acting on a result.
  • OpenGPT organizes public evidence; it does not claim to have rerun every listed evaluation.

Browse evidence hubs

Browse OpenGPT's public ranking sources, verified providers, model families, agent categories, and benchmark scopes from one crawlable research index.

  1. LMArenaPublic ranking sourcesText Style Control
  2. Artificial AnalysisPublic ranking sourcesIntelligence Index v4.1.1
  3. LiveBenchPublic ranking sourcesLiveBench-2026-06-25
  4. OpenAIModel providers7 Official model IDs
  5. AnthropicModel providers6 Official model IDs
  6. GoogleModel providers12 Official model IDs
  7. MetaModel providers5 Official model IDs
  8. DeepSeekModel providers2 Official model IDs
  9. Alibaba QwenModel providers12 Official model IDs
  10. Mistral AIModel providers6 Official model IDs
  11. xAIModel providers5 Official model IDs
  12. CohereModel providers8 Official model IDs
  13. MicrosoftModel providers5 Official model IDs
  14. Moonshot AIModel providers11 Official model IDs
  15. GPTModel families7 Official model IDs
  16. CLAUDEModel families6 Official model IDs
  17. GEMINIModel families7 Official model IDs
  18. LLAMAModel families3 Official model IDs
  19. MUSEModel families2 Official model IDs
  20. DEEPSEEKModel families2 Official model IDs
  21. QWENModel families12 Official model IDs
  22. MISTRALModel families6 Official model IDs
  23. GROKModel families5 Official model IDs
  24. CommandModel families8 Official model IDs
  25. GEMMAModel families5 Official model IDs
  26. PHIModel families5 Official model IDs
  27. KIMIModel families11 Official model IDs
  28. CodingAgent categories21 Verified products
  29. Terminal and DevOpsAgent categories7 Verified products
  30. BrowserAgent categories7 Verified products
  31. Computer useAgent categories6 Verified products
  32. Tools and APIsAgent categories7 Verified products
  33. ResearchAgent categories9 Verified products
  34. Business workflowAgent categories9 Verified products
  35. SWE-bench VerifiedAgent benchmarksVerified · Top 10 published configurations · 500 tasks
  36. Terminal-Bench 2.1Agent benchmarksterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  37. AssistantBenchAgent benchmarksHAL verified snapshot · 33 public tasks · 1 scaffold
  38. WebArenaAgent benchmarksv0.2.0 · canonical self-hosted environment
  39. OSWorld 2.0Agent benchmarkstask version v2026.06.24 · 500-step budget
  40. Berkeley Function-Calling LeaderboardAgent benchmarksBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  41. GAIAAgent benchmarksHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  42. τ²-bench CoreAgent benchmarksv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  43. τ³-Banking KnowledgeAgent benchmarksv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials