AI-model en index van bewijsmateriaal van de agent
Gebruik deze index om van een upstream-bron van provider naar een exact model, Agent-product van benchmarkrecord te gaan. Elke bestemming vermeldt wat het bewijs dekt en wat het niet kan bewijzen.
- Bronnen van openbare ranglijsten
- 2
- Modelproviders
- 11
- Modelfamilies
- 13
- Agent categories · Agent benchmarks
- 7 · 9
Bewijsbereik
Deze pagina is een index van bestaand openbaar bewijs en door providers gedocumenteerde identiteiten. Opname impliceert geen aanbeveling van OpenGPT van universele rang.
How OpenGPT handles this evidence
De index wordt gegenereerd uit dezelfde beoordeelde modelcatalogus, openbare ranglijstmomentopnamen, Agent-identiteitsdirectory van de eerste partij en benchmarkrecords die door de zichtbare ranglijsten worden gebruikt.
Vergelijkingsgrenzen
- Verschillende bronnen meten verschillende objecten en mogen niet in één universele score worden samengevoegd.
- Datums, versies en configuratie-identiteit moeten worden gecontroleerd voordat u op een resultaat handelt.
- OpenGPT ordent openbaar bewijs; het beweert niet elke vermelde evaluatie opnieuw te hebben uitgevoerd.
Bewijshubs bekijken
Bekijk vanuit één doorzoekbare onderzoeksindex de openbare ranglijstbronnen, geverifieerde providers, modelfamilies, Agent-categorieën en benchmarkbereiken van OpenGPT.
- LMArenaBronnen van openbare ranglijstenText Style Control
- LiveBenchBronnen van openbare ranglijstenLiveBench-2026-06-25
- OpenAIModelproviders7 Official model IDs
- AnthropicModelproviders6 Official model IDs
- GoogleModelproviders12 Official model IDs
- MetaModelproviders5 Official model IDs
- DeepSeekModelproviders2 Official model IDs
- Alibaba QwenModelproviders12 Official model IDs
- Mistral AIModelproviders6 Official model IDs
- xAIModelproviders5 Official model IDs
- CohereModelproviders8 Official model IDs
- MicrosoftModelproviders5 Official model IDs
- Moonshot AIModelproviders11 Official model IDs
- GPTModelfamilies7 Official model IDs
- CLAUDEModelfamilies6 Official model IDs
- GEMINIModelfamilies7 Official model IDs
- LLAMAModelfamilies3 Official model IDs
- MUSEModelfamilies2 Official model IDs
- DEEPSEEKModelfamilies2 Official model IDs
- QWENModelfamilies12 Official model IDs
- MISTRALModelfamilies6 Official model IDs
- GROKModelfamilies5 Official model IDs
- CommandModelfamilies8 Official model IDs
- GEMMAModelfamilies5 Official model IDs
- PHIModelfamilies5 Official model IDs
- KIMIModelfamilies11 Official model IDs
- ProgrammerenAgentcategorieën21 Verified products
- Terminal en DevOpsAgentcategorieën7 Verified products
- BrowserAgentcategorieën7 Verified products
- ComputergebruikAgentcategorieën6 Verified products
- Hulpmiddelen en API'sAgentcategorieën7 Verified products
- OnderzoekAgentcategorieën9 Verified products
- Zakelijke workflowAgentcategorieën9 Verified products
- SWE-bench VerifiedAgent-benchmarksVerified · Top 10 published configurations · 500 taken
- Terminal-Bench 2.1Agent-benchmarksterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchAgent-benchmarksDoor HAL geverifieerde momentopname · 33 openbare taken · 1 scaffold
- WebArenaAgent-benchmarksv0.2.0 · canonical self-hosted environment
- OSWorld 2.0Agent-benchmarkstask version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardAgent-benchmarksBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIAAgent-benchmarksHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreAgent-benchmarksv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeAgent-benchmarksv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials