أبحاث OpenGPT

فهرس أدلة نماذج AI وAgent

استخدم هذا الفهرس للانتقال من مصدر أصلي أو مزوّد إلى نموذج محدد أو منتج وكيل أو سجل معيار مرجعي. توضّح كل وجهة ما تغطيه أدلتها وما لا يمكنها إثباته.

مصادر الترتيب العام
2
مزوّدو النماذج
11
عائلات النماذج
13
Agent categories · Agent benchmarks
7 · 9

نطاق الأدلة

هذه الصفحة فهرس للأدلة العامة الموجودة والهويات الموثقة لدى المزوّدين. ولا يعني الإدراج تأييدًا من OpenGPT أو ترتيبًا عالميًا.

How OpenGPT handles this evidence

يُنشأ الفهرس من كتالوج النماذج المراجع نفسه، ولقطات لوحات الصدارة العامة، ودليل هوية الوكلاء من الطرف الأول، وسجلات المعايير المرجعية التي تستخدمها الترتيبات الظاهرة.

حدود المقارنة

  • تقيس المصادر المختلفة أشياء مختلفة، ويجب ألا تُدمج في درجة شاملة واحدة.
  • يجب التحقق من التواريخ والإصدارات وهوية الإعداد قبل اتخاذ إجراء بناءً على نتيجة.
  • تنظم OpenGPT الأدلة العامة؛ ولا تدّعي أنها أعادت تشغيل كل تقييم مدرج.

تصفح مراكز الأدلة

تصفح مصادر التصنيف العامة في OpenGPT والمزوّدين المتحقق منهم وعائلات النماذج وفئات Agent ونطاقات المعايير من فهرس بحث واحد قابل للزحف.

  1. LMArenaمصادر الترتيب العامText Style Control
  2. LiveBenchمصادر الترتيب العامLiveBench-2026-06-25
  3. OpenAIمزوّدو النماذج7 Official model IDs
  4. Anthropicمزوّدو النماذج6 Official model IDs
  5. Googleمزوّدو النماذج12 Official model IDs
  6. Metaمزوّدو النماذج5 Official model IDs
  7. DeepSeekمزوّدو النماذج2 Official model IDs
  8. Alibaba Qwenمزوّدو النماذج12 Official model IDs
  9. Mistral AIمزوّدو النماذج6 Official model IDs
  10. xAIمزوّدو النماذج5 Official model IDs
  11. Cohereمزوّدو النماذج8 Official model IDs
  12. Microsoftمزوّدو النماذج5 Official model IDs
  13. Moonshot AIمزوّدو النماذج11 Official model IDs
  14. GPTعائلات النماذج7 Official model IDs
  15. CLAUDEعائلات النماذج6 Official model IDs
  16. GEMINIعائلات النماذج7 Official model IDs
  17. LLAMAعائلات النماذج3 Official model IDs
  18. MUSEعائلات النماذج2 Official model IDs
  19. DEEPSEEKعائلات النماذج2 Official model IDs
  20. QWENعائلات النماذج12 Official model IDs
  21. MISTRALعائلات النماذج6 Official model IDs
  22. GROKعائلات النماذج5 Official model IDs
  23. Commandعائلات النماذج8 Official model IDs
  24. GEMMAعائلات النماذج5 Official model IDs
  25. PHIعائلات النماذج5 Official model IDs
  26. KIMIعائلات النماذج11 Official model IDs
  27. البرمجةفئات Agent21 Verified products
  28. الطرفية وDevOpsفئات Agent7 Verified products
  29. المتصفحفئات Agent7 Verified products
  30. استخدام الحاسوبفئات Agent6 Verified products
  31. الأدوات وواجهات APIفئات Agent7 Verified products
  32. البحثفئات Agent9 Verified products
  33. سير عمل تجاريفئات Agent9 Verified products
  34. SWE-bench Verifiedمعايير AgentVerified · Top 10 published configurations · 500 من المهام
  35. Terminal-Bench 2.1معايير Agentterminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  36. AssistantBenchمعايير Agentلقطة HAL متحقق منها · 33 مهمة عامة · بنية واحدة
  37. WebArenaمعايير Agentv0.2.0 · canonical self-hosted environment
  38. OSWorld 2.0معايير Agenttask version v2026.06.24 · 500-step budget
  39. Berkeley Function-Calling Leaderboardمعايير AgentBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  40. GAIAمعايير AgentHAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  41. τ²-bench Coreمعايير Agentv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  42. τ³-Banking Knowledgeمعايير Agentv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials