أبحاث OpenGPT
فهرس أدلة نماذج AI وAgent
استخدم هذا الفهرس للانتقال من مصدر أصلي أو مزوّد إلى نموذج محدد أو منتج وكيل أو سجل معيار مرجعي. توضّح كل وجهة ما تغطيه أدلتها وما لا يمكنها إثباته.
- مصادر الترتيب العام
- 2
- مزوّدو النماذج
- 11
- عائلات النماذج
- 13
- Agent categories · Agent benchmarks
- 7 · 9
نطاق الأدلة
هذه الصفحة فهرس للأدلة العامة الموجودة والهويات الموثقة لدى المزوّدين. ولا يعني الإدراج تأييدًا من OpenGPT أو ترتيبًا عالميًا.
How OpenGPT handles this evidence
يُنشأ الفهرس من كتالوج النماذج المراجع نفسه، ولقطات لوحات الصدارة العامة، ودليل هوية الوكلاء من الطرف الأول، وسجلات المعايير المرجعية التي تستخدمها الترتيبات الظاهرة.
حدود المقارنة
- تقيس المصادر المختلفة أشياء مختلفة، ويجب ألا تُدمج في درجة شاملة واحدة.
- يجب التحقق من التواريخ والإصدارات وهوية الإعداد قبل اتخاذ إجراء بناءً على نتيجة.
- تنظم OpenGPT الأدلة العامة؛ ولا تدّعي أنها أعادت تشغيل كل تقييم مدرج.
تصفح مراكز الأدلة
تصفح مصادر التصنيف العامة في OpenGPT والمزوّدين المتحقق منهم وعائلات النماذج وفئات Agent ونطاقات المعايير من فهرس بحث واحد قابل للزحف.
- LMArenaمصادر الترتيب العامText Style Control
- LiveBenchمصادر الترتيب العامLiveBench-2026-06-25
- OpenAIمزوّدو النماذج7 Official model IDs
- Anthropicمزوّدو النماذج6 Official model IDs
- Googleمزوّدو النماذج12 Official model IDs
- Metaمزوّدو النماذج5 Official model IDs
- DeepSeekمزوّدو النماذج2 Official model IDs
- Alibaba Qwenمزوّدو النماذج12 Official model IDs
- Mistral AIمزوّدو النماذج6 Official model IDs
- xAIمزوّدو النماذج5 Official model IDs
- Cohereمزوّدو النماذج8 Official model IDs
- Microsoftمزوّدو النماذج5 Official model IDs
- Moonshot AIمزوّدو النماذج11 Official model IDs
- GPTعائلات النماذج7 Official model IDs
- CLAUDEعائلات النماذج6 Official model IDs
- GEMINIعائلات النماذج7 Official model IDs
- LLAMAعائلات النماذج3 Official model IDs
- MUSEعائلات النماذج2 Official model IDs
- DEEPSEEKعائلات النماذج2 Official model IDs
- QWENعائلات النماذج12 Official model IDs
- MISTRALعائلات النماذج6 Official model IDs
- GROKعائلات النماذج5 Official model IDs
- Commandعائلات النماذج8 Official model IDs
- GEMMAعائلات النماذج5 Official model IDs
- PHIعائلات النماذج5 Official model IDs
- KIMIعائلات النماذج11 Official model IDs
- البرمجةفئات Agent21 Verified products
- الطرفية وDevOpsفئات Agent7 Verified products
- المتصفحفئات Agent7 Verified products
- استخدام الحاسوبفئات Agent6 Verified products
- الأدوات وواجهات APIفئات Agent7 Verified products
- البحثفئات Agent9 Verified products
- سير عمل تجاريفئات Agent9 Verified products
- SWE-bench Verifiedمعايير AgentVerified · Top 10 published configurations · 500 من المهام
- Terminal-Bench 2.1معايير Agentterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBenchمعايير Agentلقطة HAL متحقق منها · 33 مهمة عامة · بنية واحدة
- WebArenaمعايير Agentv0.2.0 · canonical self-hosted environment
- OSWorld 2.0معايير Agenttask version v2026.06.24 · 500-step budget
- Berkeley Function-Calling Leaderboardمعايير AgentBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIAمعايير AgentHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench Coreمعايير Agentv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking Knowledgeمعايير Agentv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials