قرارات مستقلة بشأن النماذج

ترتيب نماذج الذكاء الاصطناعي

أنشئ قائمة مختصرة بإصدارات النماذج الدقيقة من الأدلة العامة، وقارنها على أساس واحد، ثم تحقق من الاختيار على مهمتك.

المهام الموضوعيةLiveBench · عرض 3 من 10
  1. الترتيب 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. الترتيب 2Claude Fable 5 Max EffortAnthropic82.97
  3. الترتيب 3GPT-6 Astra Max EffortOpenAI82.16
بيانات من تقييمات منشورةالمصادر العامة الخارجية: 2LiveBench · بيانات هذه النسخة حتى

ينظم OpenGPT بيانات تقييمات خارجية منشورة علنًا ويعرضها، ولم يُعِد اختبار هذه النماذج. استخدم الترتيب لفهم الأداء النسبي، ثم اختبر النماذج المرشحة على مهامك الفعلية.

إصدار البيانات
2026-09منشور ·
نطاق القرار المؤتمت
20 قيد التحقق الآلي / 79 من نماذج الكتالوجتاريخ قطع البيانات · 2026-08-30
لقطة التصنيف الحالية · LiveBench
2026-09-07 · 56 من سجلات المصدر
أحدث إصدار لتغييرات قابلة للمقارنة · LiveBench
غير معروف
تغطية دورة الحياة
36 من حالات دورة الحياة موثقة / 79 · 20 ضمن نطاق الأتمتةتاريخ قطع البيانات · 2026-08-30

اختر زاوية الترتيب

ابدأ بالقرار الذي تحتاج إلى اتخاذه. يفتح كل سيناريو إشارة التصنيف المنشورة الأكثر صلة. يظل المصدر والمقياس الأصليان ظاهرين.

اختر ما تريد عرضه

يعرض جميع السجلات المنشورة مع معرّف النموذج أو اسمه في المصدر، بما فيها الأسماء البديلة والإعدادات، مع الحفاظ على ترتيب المصدر.

المهام الموضوعية. الدرجة الإجمالية في LiveBench عبر 23 مهمة مصححة موضوعيًا ضمن سبع فئات.

عرض 10 من 10. المهام الموضوعية.

  1. الترتيب 1
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    claude-fable-5-1-max-effort
    المهام الموضوعية
    83.41
    المصدر الأصلي
  2. الترتيب 2
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    claude-fable-5-max-effort
    المهام الموضوعية
    82.97
    المصدر الأصلي
  3. الترتيب 3
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    gpt-6-astra-max
    المهام الموضوعية
    82.16
    المصدر الأصلي
  4. الترتيب 4
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    muse-spark-1.3-xhigh
    المهام الموضوعية
    81.59
    المصدر الأصلي
  5. الترتيب 5
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    gpt-5.6-sol-max
    المهام الموضوعية
    81.05
    المصدر الأصلي
  6. الترتيب 6
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    gpt-5.5-xhigh
    المهام الموضوعية
    80.19
    المصدر الأصلي
  7. الترتيب 7
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    claude-opus-5-max-effort
    المهام الموضوعية
    80.08
    المصدر الأصلي
  8. الترتيب 8

    Kimi K3

    Moonshot AI
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    kimi-k3
    المهام الموضوعية
    79.19
    المصدر الأصلي
  9. الترتيب 9
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    gemini-3.7-flash-high
    المهام الموضوعية
    78.83
    المصدر الأصلي
  10. الترتيب 10
    إعدادات النموذج
    Published benchmark configuration
    معرّف النموذج في المصدر
    qwen3.8-max
    المهام الموضوعية
    78.46
    المصدر الأصلي
مصدر مستقلLiveBench10 إدخالًا منشورًا · تاريخ الجمع: 9 سبتمبر 2026
LiveBench

حالة المراقبةحالة الخدمة المباشرة غير متاحةنشر تلقائي متحقق منه

تاريخ بيانات المصدر
استرجاع OpenGPT
آخر تغيير في الترتيب

LMArena + LiveBench: نشر آلي تم التحقق منه · المصادر المتوقفة مؤقتًا: تاريخية فقط

منهجية الترتيبيحافظ كل عرض على مقياس المصدر وإصداره ومنهجيته. اتبع الروابط لتدقيق العمل الأساسي.

أساس الترتيب

التصنيف المنشور كاملًا ومعرّفات النماذج الرسمية

يحافظ الترتيب الرئيسي على كل سجل ناشر ويعرض معرّف نموذج المصدر أو اسمه. ويمكن مقارنة كل صف: تستخدم المطابقات الدقيقة الآمنة من ناحية التهيئة إصدارات رسمية؛ وتبقى كل الصفوف الأخرى ضمن ترتيب مصدر واحد. ولا تتحول البيانات المفقودة إلى درجة صفر مطلقًا.
79 من معرّفات النماذج الرسمية
79
0 مع بيانات تصنيف عامة
0
79 بانتظار بيانات قابلة للمقارنة
79
LiveBench · تم الاحتفاظ بـ 56 من سجلات المصدر لأغراض التدقيق
56
دليل النماذج

أساس الترتيب

كيفية قراءة هذا الإصدار البحثي

  • تبقى الدرجات على مقاييس ناشريها الأصلية. ولا تُدمج في درجة مركّبة.

  • البيانات المفقودة لا تعني صفرًا، بل تعني أن الناشر لم يُبلغ عن ذلك المقياس لهذه اللقطة.

  • عندما يبلغ مصدر عن إعدادات نموذج، ينطبق الموضع على تلك التهيئة وإصدار المصدر المحددين، لا على كل مهمة أو منطقة أو عملية نشر.

  • لا يستطيع أي مزوّد الدفع مقابل موضع في القائمة. تربط OpenGPT مباشرة بالأدلة المستخدمة.

أساس الترتيب

البيانات والمصادر

يحافظ كل عرض على مقياس المصدر وإصداره ومنهجيته. اتبع الروابط لتدقيق العمل الأساسي.
AR

LMArena

الترتيب العام الكامل والأحدث والمضبوط أسلوبيًا، استنادًا إلى مقارنة المستخدمين بين إجابتي نموذجين جنبًا إلى جنب.

تاريخ نشر الترتيب
2 سبتمبر 2026
تاريخ الجمع
9 سبتمبر 2026
الترخيص
CC BY 4.0

الترتيب الأصليالمنهجية

LB

LiveBench

ثلاث وعشرون مهمة موضوعية موزعة على سبع فئات؛ وتتجدد الأسئلة كل ستة أشهر.

إصدار البيانات
LiveBench-2026-06-25
تاريخ الجمع
9 سبتمبر 2026
الترخيص
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

الترتيب الأصليالمنهجية

إصدار المنهجية

إيقاع نشر متوقع

تفحص OpenGPT مصادر النماذج النشطة كل ست ساعات. ولا تنشر LMArena وLiveBench إلا بعد اجتياز سياسات التحقق ذات الإصدارات. وتظل المصادر المتوقفة مؤقتًا تاريخية ولا تدخل في الترتيبات الحالية.
  1. 01

    فحص المصادر كل 6 ساعات

    لا تُنشر تحديثات LMArena وLiveBench تلقائيًا إلا بعد فحوص المخطط والاكتمال والتاريخ والسلامة والشذوذ. وتظل المصادر المتوقفة مؤقتًا تاريخية.

  2. 02

    ملخص أسبوعي للتغييرات

    يلخص التغييرات المهمة في الترتيب والنماذج والمصادر ضمن تحديث واحد قابل للمراجعة.

  3. 03

    لقطة شهرية للسجل

    يثبت لقطة مؤرخة تتضمن الإعدادات الدقيقة وإصدارات المصادر والتصحيحات.