OpenGPT-ONDERZOEK

AI-model en index van bewijsmateriaal van de agent

Gebruik deze index om van een upstream-bron van provider naar een exact model, Agent-product van benchmarkrecord te gaan. Elke bestemming vermeldt wat het bewijs dekt en wat het niet kan bewijzen.

Bronnen van openbare ranglijsten
2
Modelproviders
11
Modelfamilies
13
Agent categories · Agent benchmarks
7 · 9

Bewijsbereik

Deze pagina is een index van bestaand openbaar bewijs en door providers gedocumenteerde identiteiten. Opname impliceert geen aanbeveling van OpenGPT van universele rang.

How OpenGPT handles this evidence

De index wordt gegenereerd uit dezelfde beoordeelde modelcatalogus, openbare ranglijstmomentopnamen, Agent-identiteitsdirectory van de eerste partij en benchmarkrecords die door de zichtbare ranglijsten worden gebruikt.

Vergelijkingsgrenzen

  • Verschillende bronnen meten verschillende objecten en mogen niet in één universele score worden samengevoegd.
  • Datums, versies en configuratie-identiteit moeten worden gecontroleerd voordat u op een resultaat handelt.
  • OpenGPT ordent openbaar bewijs; het beweert niet elke vermelde evaluatie opnieuw te hebben uitgevoerd.

Bewijshubs bekijken

Bekijk vanuit één doorzoekbare onderzoeksindex de openbare ranglijstbronnen, geverifieerde providers, modelfamilies, Agent-categorieën en benchmarkbereiken van OpenGPT.

  1. LMArenaBronnen van openbare ranglijstenText Style Control
  2. LiveBenchBronnen van openbare ranglijstenLiveBench-2026-06-25
  3. OpenAIModelproviders7 Official model IDs
  4. AnthropicModelproviders6 Official model IDs
  5. GoogleModelproviders12 Official model IDs
  6. MetaModelproviders5 Official model IDs
  7. DeepSeekModelproviders2 Official model IDs
  8. Alibaba QwenModelproviders12 Official model IDs
  9. Mistral AIModelproviders6 Official model IDs
  10. xAIModelproviders5 Official model IDs
  11. CohereModelproviders8 Official model IDs
  12. MicrosoftModelproviders5 Official model IDs
  13. Moonshot AIModelproviders11 Official model IDs
  14. GPTModelfamilies7 Official model IDs
  15. CLAUDEModelfamilies6 Official model IDs
  16. GEMINIModelfamilies7 Official model IDs
  17. LLAMAModelfamilies3 Official model IDs
  18. MUSEModelfamilies2 Official model IDs
  19. DEEPSEEKModelfamilies2 Official model IDs
  20. QWENModelfamilies12 Official model IDs
  21. MISTRALModelfamilies6 Official model IDs
  22. GROKModelfamilies5 Official model IDs
  23. CommandModelfamilies8 Official model IDs
  24. GEMMAModelfamilies5 Official model IDs
  25. PHIModelfamilies5 Official model IDs
  26. KIMIModelfamilies11 Official model IDs
  27. ProgrammerenAgentcategorieën21 Verified products
  28. Terminal en DevOpsAgentcategorieën7 Verified products
  29. BrowserAgentcategorieën7 Verified products
  30. ComputergebruikAgentcategorieën6 Verified products
  31. Hulpmiddelen en API'sAgentcategorieën7 Verified products
  32. OnderzoekAgentcategorieën9 Verified products
  33. Zakelijke workflowAgentcategorieën9 Verified products
  34. SWE-bench VerifiedAgent-benchmarksVerified · Top 10 published configurations · 500 taken
  35. Terminal-Bench 2.1Agent-benchmarksterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  36. AssistantBenchAgent-benchmarksDoor HAL geverifieerde momentopname · 33 openbare taken · 1 scaffold
  37. WebArenaAgent-benchmarksv0.2.0 · canonical self-hosted environment
  38. OSWorld 2.0Agent-benchmarkstask version v2026.06.24 · 500-step budget
  39. Berkeley Function-Calling LeaderboardAgent-benchmarksBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  40. GAIAAgent-benchmarksHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  41. τ²-bench CoreAgent-benchmarksv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  42. τ³-Banking KnowledgeAgent-benchmarksv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials