LMArena
الترتيب العام الكامل والأحدث والمضبوط أسلوبيًا، استنادًا إلى مقارنة المستخدمين بين إجابتي نموذجين جنبًا إلى جنب.
- تاريخ نشر الترتيب
- 2 سبتمبر 2026
- تاريخ الجمع
- 9 سبتمبر 2026
- الترخيص
- CC BY 4.0
قرارات مستقلة بشأن النماذج
أنشئ قائمة مختصرة بإصدارات النماذج الدقيقة من الأدلة العامة، وقارنها على أساس واحد، ثم تحقق من الاختيار على مهمتك.
ينظم OpenGPT بيانات تقييمات خارجية منشورة علنًا ويعرضها، ولم يُعِد اختبار هذه النماذج. استخدم الترتيب لفهم الأداء النسبي، ثم اختبر النماذج المرشحة على مهامك الفعلية.
ابدأ بالقرار الذي تحتاج إلى اتخاذه. يفتح كل سيناريو إشارة التصنيف المنشورة الأكثر صلة. يظل المصدر والمقياس الأصليان ظاهرين.
يعرض جميع السجلات المنشورة مع معرّف النموذج أو اسمه في المصدر، بما فيها الأسماء البديلة والإعدادات، مع الحفاظ على ترتيب المصدر.
المهام الموضوعية. الدرجة الإجمالية في LiveBench عبر 23 مهمة مصححة موضوعيًا ضمن سبع فئات.
عرض 10 من 10. المهام الموضوعية.
أساس الترتيب
أساس الترتيب
تبقى الدرجات على مقاييس ناشريها الأصلية. ولا تُدمج في درجة مركّبة.
البيانات المفقودة لا تعني صفرًا، بل تعني أن الناشر لم يُبلغ عن ذلك المقياس لهذه اللقطة.
عندما يبلغ مصدر عن إعدادات نموذج، ينطبق الموضع على تلك التهيئة وإصدار المصدر المحددين، لا على كل مهمة أو منطقة أو عملية نشر.
لا يستطيع أي مزوّد الدفع مقابل موضع في القائمة. تربط OpenGPT مباشرة بالأدلة المستخدمة.
أساس الترتيب
الترتيب العام الكامل والأحدث والمضبوط أسلوبيًا، استنادًا إلى مقارنة المستخدمين بين إجابتي نموذجين جنبًا إلى جنب.
ثلاث وعشرون مهمة موضوعية موزعة على سبع فئات؛ وتتجدد الأسئلة كل ستة أشهر.
إصدار المنهجية
لا تُنشر تحديثات LMArena وLiveBench تلقائيًا إلا بعد فحوص المخطط والاكتمال والتاريخ والسلامة والشذوذ. وتظل المصادر المتوقفة مؤقتًا تاريخية.
يلخص التغييرات المهمة في الترتيب والنماذج والمصادر ضمن تحديث واحد قابل للمراجعة.
يثبت لقطة مؤرخة تتضمن الإعدادات الدقيقة وإصدارات المصادر والتصحيحات.