Modell AI und Agenten-Nachweisindex
Diesen Index verwenden, um von einer Upstream-Quelle oder einem Anbieter zu einem exakten Modell, Agent-Produkt oder Benchmark-Datensatz zu gelangen. Jedes Ziel gibt an, was seine Evidenz abdeckt und was sie nicht nachweisen kann.
- Quellen öffentlicher Rankings
- 2
- Modellanbieter
- 11
- Modellfamilien
- 13
- Agent categories · Agent benchmarks
- 7 · 9
Nachweisumfang
Diese Seite ist ein Index vorhandener öffentlicher Evidenz und anbieterdokumentierter Identitäten. Die Aufnahme stellt weder eine Empfehlung durch OpenGPT noch einen allgemeingültigen Rang dar.
How OpenGPT handles this evidence
Der Index wird aus demselben geprüften Modellkatalog, denselben Momentaufnahmen öffentlicher Ranglisten, demselben Erstanbieter-Verzeichnis für Agent-Identitäten und denselben Benchmark-Datensätzen erzeugt, die auch für die sichtbaren Ranglisten verwendet werden.
Vergleichsgrenzen
- Verschiedene Quellen messen unterschiedliche Gegenstände und dürfen nicht zu einem universellen Gesamtwert zusammengeführt werden.
- Datum, Version und Konfigurationsidentität müssen geprüft werden, bevor aufgrund eines Ergebnisses gehandelt wird.
- OpenGPT ordnet öffentliche Evidenz; es behauptet nicht, jede aufgeführte Evaluierung erneut ausgeführt zu haben.
Beleg-Hubs durchsuchen
Durchsuchen Sie OpenGPTs öffentliche Ranking-Quellen, verifizierte Anbieter, Modellfamilien, Agentenkategorien und Benchmark-Umfänge in einem zentralen, crawlbaren Forschungsindex.
- LMArenaQuellen öffentlicher RankingsText Style Control
- LiveBenchQuellen öffentlicher RankingsLiveBench-2026-06-25
- OpenAIModellanbieter7 Official model IDs
- AnthropicModellanbieter6 Official model IDs
- GoogleModellanbieter12 Official model IDs
- MetaModellanbieter5 Official model IDs
- DeepSeekModellanbieter2 Official model IDs
- Alibaba QwenModellanbieter12 Official model IDs
- Mistral AIModellanbieter6 Official model IDs
- xAIModellanbieter5 Official model IDs
- CohereModellanbieter8 Official model IDs
- MicrosoftModellanbieter5 Official model IDs
- Moonshot AIModellanbieter11 Official model IDs
- GPTModellfamilien7 Official model IDs
- CLAUDEModellfamilien6 Official model IDs
- GEMINIModellfamilien7 Official model IDs
- LLAMAModellfamilien3 Official model IDs
- MUSEModellfamilien2 Official model IDs
- DEEPSEEKModellfamilien2 Official model IDs
- QWENModellfamilien12 Official model IDs
- MISTRALModellfamilien6 Official model IDs
- GROKModellfamilien5 Official model IDs
- CommandModellfamilien8 Official model IDs
- GEMMAModellfamilien5 Official model IDs
- PHIModellfamilien5 Official model IDs
- KIMIModellfamilien11 Official model IDs
- ProgrammierenAgentenkategorien21 Verified products
- Terminal und DevOpsAgentenkategorien7 Verified products
- BrowserAgentenkategorien7 Verified products
- ComputersteuerungAgentenkategorien6 Verified products
- Tools und APIsAgentenkategorien7 Verified products
- RechercheAgentenkategorien9 Verified products
- Geschäftlicher ArbeitsablaufAgentenkategorien9 Verified products
- SWE-bench VerifiedAgenten-BenchmarksVerified · Top 10 published configurations · 500 Aufgaben
- Terminal-Bench 2.1Agenten-Benchmarksterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchAgenten-BenchmarksVon HAL verifizierter Snapshot · 33 öffentliche Aufgaben · 1 Scaffold
- WebArenaAgenten-Benchmarksv0.2.0 · canonical self-hosted environment
- OSWorld 2.0Agenten-Benchmarkstask version v2026.06.24 · 500-step budget
- Berkeley Function-Calling LeaderboardAgenten-BenchmarksBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIAAgenten-BenchmarksHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench CoreAgenten-Benchmarksv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking KnowledgeAgenten-Benchmarksv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials