OpenGPT RESEARCH

AI model and agent evidence index

Use this index to move from an upstream source or provider to an exact model, Agent product, or benchmark record. Each destination states what its evidence covers and what it cannot prove.

Public ranking sources
2
Model providers
11
Model families
13
Agent categories · Agent benchmarks
7 · 9

Evidence scope

This page is an index of existing public evidence and provider-documented identities. Inclusion does not imply an OpenGPT endorsement or a universal rank.

How OpenGPT handles this evidence

The index is generated from the same reviewed model catalog, public leaderboard snapshots, first-party Agent identity directory, and benchmark records used by the visible rankings.

Comparison boundaries

  • Different sources measure different objects and must not be merged into one universal score.
  • Dates, versions, and configuration identity must be checked before acting on a result.
  • OpenGPT organizes public evidence; it does not claim to have rerun every listed evaluation.

Browse evidence hubs

Browse OpenGPT's public ranking sources, verified providers, model families, agent categories, and benchmark scopes from one crawlable research index.

  1. LMArenaPublic ranking sourcesText Style Control
  2. LiveBenchPublic ranking sourcesLiveBench-2026-06-25
  3. OpenAIModel providers9 Official model IDs
  4. AnthropicModel providers8 Official model IDs
  5. GoogleModel providers14 Official model IDs
  6. MetaModel providers6 Official model IDs
  7. DeepSeekModel providers3 Official model IDs
  8. Alibaba QwenModel providers15 Official model IDs
  9. Mistral AIModel providers6 Official model IDs
  10. xAIModel providers6 Official model IDs
  11. CohereModel providers8 Official model IDs
  12. MicrosoftModel providers5 Official model IDs
  13. Moonshot AIModel providers11 Official model IDs
  14. GPTModel families9 Official model IDs
  15. CLAUDEModel families8 Official model IDs
  16. GEMINIModel families9 Official model IDs
  17. LLAMAModel families3 Official model IDs
  18. MUSEModel families3 Official model IDs
  19. DEEPSEEKModel families3 Official model IDs
  20. QWENModel families15 Official model IDs
  21. MISTRALModel families6 Official model IDs
  22. GROKModel families6 Official model IDs
  23. CommandModel families8 Official model IDs
  24. GEMMAModel families5 Official model IDs
  25. PHIModel families5 Official model IDs
  26. KIMIModel families11 Official model IDs
  27. CodingAgent categories21 Verified products
  28. Terminal and DevOpsAgent categories7 Verified products
  29. BrowserAgent categories7 Verified products
  30. Computer useAgent categories6 Verified products
  31. Tools and APIsAgent categories7 Verified products
  32. ResearchAgent categories9 Verified products
  33. Business workflowAgent categories9 Verified products
  34. SWE-bench VerifiedAgent benchmarksVerified · Top 10 published configurations · 500 tasks
  35. Terminal-Bench 2.1Agent benchmarksterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  36. AssistantBenchAgent benchmarksHAL verified snapshot · 33 public tasks · 1 scaffold
  37. WebArenaAgent benchmarksv0.2.0 · canonical self-hosted environment
  38. OSWorld 2.0Agent benchmarkstask version v2026.06.24 · 500-step budget
  39. Berkeley Function-Calling LeaderboardAgent benchmarksBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  40. GAIAAgent benchmarksHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  41. τ²-bench CoreAgent benchmarksv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  42. τ³-Banking KnowledgeAgent benchmarksv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials