لا يوجد نموذج يستوفي جميع المتطلبات
راجع المتطلب الذي استبعد كل مرشح، ثم خفف فقط قيدًا مرنًا بالفعل.
متطلبات المراجعةاعثر على سير العمل المناسب واتبع كل خطوة وافهم ما يمكن للنتيجة أن تخبرك به وما لا يمكنها.
يجيب كل سير عمل عن سؤال مختلف. ابدأ بالهدف الأقرب، ثم اتبع الدليل المرتبط.
اطّلع على ما هو مصنّف ومصدر البيانات والسجلات التي تتضمن معرّف نموذج رسميًا.
استخدم كل زاوية ترتيب لفحص المؤشرات المنشورة ومراجعة سجلات المصدر وبناء قائمة مختصرة للاختبار على مهام حقيقية.
ابدأ بالسؤال الذي تحتاج إلى إجابته. تستخدم تفضيلات المستخدمين والقدرة العامة والمهام الموضوعية والتكلفة وترتيبات النماذج مفتوحة الأوزان مصادر ومقاييس مختلفة.
الترتيب نسبي إلى مصدر ونطاق واحدين. قد تؤدي التعادلات إلى تخطي أرقام ترتيب، ودرجات زوايا التصنيف المختلفة ليست قابلة للمقارنة مباشرة.
تنظم OpenGPT بيانات عامة من جهات خارجية ولم تُعد تشغيل هذه التقييمات. ولا يحدد أي ترتيب أفضل نموذج لكل مستخدم أو مهمة.
يتضمن كل صف الآن تفاصيل النموذج وإجراء مقارنة. لا يضيف OpenGPT معرّف نموذج رسميًا إلا عندما تثبت وثائق المزوّد الربط الدقيق؛ وإلا فتحافظ مقارنة سجل المصدر على اسم الناشر والإعداد وبيانات التصنيف دون اختلاق معرّف رسمي جديد.
اختر Agent حسب المهمة والإعداد الكامل وجودة الأدلة والنتائج القابلة للمقارنة.
استكشف 96 إعداد تقييم Agent منشورًا عبر سبعة نطاقات مهام، إضافة إلى 109 نتائج منفصلة لنماذج استدعاء الأدوات في BFCL، دون تحويل الأدلة غير المتوافقة إلى درجة واحدة.
تنتمي نتيجة Agent إلى تكوين كامل واحد: النموذج الأساسي والبنية والأدوات والأذونات والميزانية والبيئة وإصدار المعيار والتاريخ. يحتفظ OpenGPT بالحقول التي أبلغ عنها المصدر ويترك الحقول المفقودة دون إبلاغ، لا بقيمة صفر.
يصف الترتيب تكوين نظام كاملًا ضمن نطاق معيار واحد. اقرأه مع درجة الدليل وحداثته وعدد العينات أو عمليات التشغيل وأي حقول مُبلّغ عنها للتكلفة والموثوقية.
لا تنشئ OpenGPT درجة عالمية للوكلاء. وما لم تُصنف النتيجة صراحةً بأنها أُعيد إنتاجها، فإن OpenGPT تنظم الأدلة الأولية بدلًا من إعادة تشغيلها؛ ولا يثبت أي معيار جاهزية الإنتاج لكل سير عمل.
يُنشئ أي اختلاف في البنية أو إصدار النموذج أو مجموعة الأدوات أو مستوى الأذونات أو الميزانية أو إعداد المعيار تكوين وكيل مختلفًا، ويجب أن يظل سجلًا منفصلًا.
أرسل سجل هوية أو أدلة عامًا للمراجعة من دون تغيير التصنيفات.
استخدم مسار التقديم عندما يكون معرّف نموذج رسمي أو منتج وكيل مفقودًا، أو عندما يحتاج مصدر عام إلى مراجعة تحريرية.
سجّل الدخول باستخدام حساب متحقق منه وجهّز مصدر HTTPS عامًا. لا ترسل أبدًا بيانات اعتماد أو ملفات خاصة أو معلومات شخصية.
يحصل الإرسال الناجح على رقم مرجعي ويدخل قائمة انتظار المراجعة. منتج Agent المعتمد سجل دليل عام، وليس ترتيبًا في لوحة الصدارة أو توصية من OpenGPT.
لا يستطيع مقدّمو الطلبات تحديد الترتيب أو درجة الأدلة أو قابلية المقارنة أو حالة النشر. وتقلل حدود التكرار والمعدل من إساءة الاستخدام، ولا تغيّر الموافقة أي ترتيب تلقائيًا.
يمكن البحث عن منتجات Agent المعتمدة في الدليل، لكن إدراجها في ترتيب لا يزال يتطلب أدلة تقييم عامة قابلة للمقارنة.
تتبّع الحركة عبر اللقطات القابلة للمقارنة، وقارن معرّفات نماذج الكتالوج.
استخدم هذه الصفحة لمعرفة ما تغيّر منذ لقطة المصدر السابقة، والسجلات التي ظهرت لأول مرة، واختلاف الإصدارات المحددة، ووقت استرداد البيانات.
تستخدم الحركة التاريخية حاليًا نطاق تفضيلات المستخدم في LMArena. تظل المصادر النشطة الأخرى للحالة الحالية فقط حتى تتوفر لقطة سابقة قابلة للمقارنة.
لا تحسب OpenGPT الحركة إلا عند تطابق المصدر والنطاق والوحدة والمنهج، وتحتفظ بلقطات شهرية قابلة للتنزيل.
لا تُعد تواريخ إصدار المنتجات إلا إذا وثقها المزوّد. ولا تستنتج مقارنة الإصدارات السرعة أو السعر أو طول السياق أو الجودة من الأسماء.
لم تجمّد OpenGPT إصدارًا سابقًا قابلًا للمقارنة لهذا المصدر النشط. وتظل المصادر المتوقفة مؤقتًا تاريخية بدلًا من المساهمة في الحركة الحالية.
ابدأ بسيناريو عمل حقيقي وراجع ثلاثة إصدارات رسمية للنماذج تستحق الاختبار أولًا.
استخدم ترتيبات المهام لتحويل المؤشرات العامة الواسعة إلى قائمة مختصرة وعملية للبرمجة أو البحث أو المستندات أو الدعم أو العمل متعدد اللغات أو متعدد الوسائط أو التكلفة أو الخصوصية أو السرعة.
اختر المهمة الأقرب إلى عملك، ثم دوّن مطالباتك وبياناتك وأدواتك ومنطقتك وميزانيتك ومتطلبات الخصوصية الفعلية. قد تغطي الأدلة العامة المعروضة نطاقًا أوسع من مهمتك.
ستحصل على ثلاثة مرشحين رسميين للبدء، وأدلة عامة ظاهرة عند توفرها، ومسارات مباشرة للمقارنة أو إجراء اختبار على مهمة حقيقية.
ترتيب المهمة قائمة مختصرة أولية، وليس ترتيبًا شاملًا أو إثباتًا لأفضل نموذج. الدليل المفقود ليس صفرًا، ولا تُدمج المصادر العامة غير المتشابهة في درجة واحدة.
قد يكون إصدار رسمي ذا صلة بالمهمة بسبب موضع المنتج أو نوع النشر حتى عندما لا تكون هناك نتيجة لإصدار دقيق مرتبطة بالمصدر العام المحدد. يظل الدليل المفقود ظاهرًا ويجب حسمه باختبارك الخاص.
حدد النماذج التي تستخدمها وأعمالك المتكررة وأولوياتك، ثم راجع إشارات حذرة لمعرفة متى تكون المقارنة العادلة مجدية.
استخدم الرادار للإجابة عن سؤال عملي: هل توجد أدلة عامة قابلة للمقارنة تكفي لاختبار بديل للنموذج الذي تستخدمه الآن؟
اختر إصدارات رسمية دقيقة ومهمة متكررة واحدة على الأقل وأولوية أو أولويتين كحد أقصى. استخدم المتصفح والجهاز نفسيهما لأن الإعداد يبقى محليًا.
ينشئ الرادار فحص ترقية محليًا على الجهاز، يتضمن نموذجًا حاليًا وبديلًا ملائمًا للمهمة عند توفره وتاريخ الأدلة وحدود عدم اليقين وإجراءات مقارنة مباشرة.
فحص الترقية ليس أمرًا بالتبديل. قد تظل التكلفة أو السرعة أو الخصوصية أو السياق تتطلب اختبارًا مباشرًا، ولا تتم مزامنة الإعدادات المحلية أو نسخها احتياطيًا.
لا. يعني ذلك أن إشارة قابلة للمقارنة أو تغييرًا في دورة الحياة يجعل الاختبار على المهمة نفسها جديرًا بالتنفيذ. لا تبدّل إلا بعد نجاح البديل على عملك الفعلي وضمن قيودك.
حوّل أربعة متطلبات عملية إلى قائمة مختصرة قابلة للتفسير.
استخدم أداة البحث عندما تعرف العمل المطلوب، لكنك لا تعرف أي سلسلة نماذج ينبغي استقصاؤها أولًا.
حدّد المهمة الرئيسية والمكان الذي قد يعمل فيه النموذج وأهم أولوية تشغيلية لديك وأي متطلبات لغوية.
تنطبق التسمية النوعية وعدد مطابقات المتطلبات على سلسلة النماذج، لا الإصدارات الفردية؛ وليست أي منهما درجة معيار مرجعي. تحقّق من توفر نشر كل إصدار حالي مُدرج، وقارن المرشحين على المهام نفسها.
لا تستدعي أداة البحث النماذج، ولا تتحقق من الأسعار الحالية، ولا تسمي فائزًا عالميًا. ويمكن أن تتضمن سلسلة نماذج إصدارات بقدرات مختلفة.
يعكس الترتيب القيود التي حددتها، لا الشعبية العامة. غيّر متطلبًا واحدًا لترى ما سبّب النتيجة، ثم اختبر الإصدارات المحددة.
تصفح معرّفات النماذج الموثقة من المزوّد، وافتح صفحات التفاصيل المخصصة، وتحقق من وجود بيانات تصنيف عامة قابلة للمقارنة.
استخدم الدليل عندما تحتاج إلى معرّف نموذج رسمي محدد، أو وجهة المزوّد، أو المهام المناسبة وغير المناسبة، أو المصادر، أو حالة واضحة لبيانات الترتيب.
أدخل اسم نموذج أو مزوّدًا أو حاجة نشر أو مهمة. لا يضمن معرّف نموذج موثق من المزوّد وجود بيانات تقييم عامة قابلة للمقارنة.
تعني «مصنّف» أن بيانات منشورة قابلة للمقارنة مرتبطة بمعرّف النموذج الدقيق. وتعني «غير مصنّف» أن هذا الإصدار لا يتضمن سجلًا مناسبًا قابلًا للمقارنة؛ ولا يعني ذلك درجة صفر.
تثبت وثائق المزود هوية العنصر في الدليل، لا توفره الحالي في كل بلد أو فئة خدمة. قد تتغير تغطية التصنيف وتفاصيل النموذج وشروط المزود بعد تاريخ المراجعة.
لا. يعني ذلك أن هذه النسخة تفتقر إلى بيانات عامة مناسبة وقابلة للمقارنة لمُعرّف النموذج هذا. اختبره مباشرة إذا ظل ذا صلة بقرارك.
قارن من إصدارين إلى أربعة إصدارات رسمية دقيقة، أو سجلات من عرض تصنيف منشور واحد.
تنظّم مقارنة الإصدارات الرسمية المعرّفات الموثقة من المزوّد عبر المصادر المنشورة. وتحافظ مقارنة سجلات المصادر على اسم الناشر وإعداداته عندما تؤدي المقارنة الرسمية الدقيقة إلى فقدان معلومات.
للإصدارات الرسمية، اختر من معرّفين إلى أربعة معرّفات من الكتالوج. ولسجلات المصدر، اختر من صفين إلى أربعة من المصدر والبُعد واللقطة نفسها.
تنشئ المقارنة قائمة مختصرة تراعي الأدلة وتوضح مواضع نقص المعلومات. ولا تنتج درجة جديدة لمعيار مرجعي، ولا تعلن فائزًا عالميًا.
لا تستدعي OpenGPT النماذج في طريقة العرض هذه. ولا يمكن تبادل الدرجات المنشورة من مصادر أو نطاقات مختلفة، وقد تتغير تفاصيل النماذج بعد تاريخ مراجعتها.
تلخص مقارنة البيانات معلومات منشورة بالفعل لنموذجين إلى أربعة نماذج. يأخذ التقييم على مهام حقيقية إصدارين بالضبط، ويطلب منك تشغيل المطالبات نفسها في الخدمتين، ثم يراجع الإجابات الملصقة مع إخفاء تسميات النماذج الظاهرة.
احتفظ في هذا المتصفح بقائمة عمل صغيرة من عناصر الترتيب.
استخدم «النماذج المحفوظة» للعودة سريعًا إلى المرشحين، وفتح الوجهات الموثوقة، ونقل معرّفات النماذج المدعومة إلى مقارنة.
استخدم المتصفح والجهاز نفسيهما. تُخزّن القائمة محليًا من دون حساب OpenGPT أو مزامنة سحابية.
يوضح العدد بجوار «النماذج المحفوظة» عدد الإدخالات المحفوظة. وتظل هوية المصدر منفصلة عن هوية النموذج الرسمية.
القائمة ليست حسابًا أو مزامنة للإشارات المرجعية أو نسخة احتياطية. لن يراها متصفح أو جهاز آخر، وقد يزيلها التصفح الخاص أو قيود التخزين أو مسح بيانات الموقع.
تحقق من أنك تستخدم ملف المتصفح والجهاز نفسيهما. إذا مُسحت بيانات الموقع أو حُظرت، فلن يستطيع OpenGPT استعادة القائمة المحلية.
نفّذ تجربة خاصة على عمل حقيقي؛ يحتفظ الوضع المؤقت بالمخرجات الخام في الذاكرة ما لم تتعمد الاحتفاظ بها على هذا الجهاز.
قارن بين إعدادين إلى أربعة إعدادات دقيقة لنموذج أو Agent باستخدام حزمة مهام واحدة مضبوطة وقابلة للتدقيق.
سجّل كل إعداد دقيق وافتح خدمات المزود ذات الصلة وأزل البيانات الحساسة وتذكّر أن سياسات المزود تسري على كل ما ترسله إليه.
النتيجة حصيلة مؤكدة من المستخدم ومرتبطة بحزمة المهام المجمّدة والتهيئات المسجلة. تصدير البيانات الوصفية فقط هو الخيار الافتراضي؛ ويتطلب تصدير البيانات الخام الكاملة موافقة صريحة، ويمكن لأداة التحقق المحلية فحصه.
يقلل إخفاء التسميات من تحيز الأسماء الظاهرة، لكنه لا يجعل التقييم مزدوج التعمية. لا تشغّل OpenGPT خدمات المزوّدين، ولا تثبت مصدر المخرجات أو دقة الإعداد أو اكتماله أو الخصوصية لدى المزوّدين الخارجيين أو قابلية التعميم خارج هذه المهام. نتائج التجارب الخاصة مصنفة «مُختبر على عملك»، وليست «أدلة عامة».
تُجرى التجربة في متصفحك. يحتفظ الوضع المؤقت بالمخرجات الخام في الذاكرة؛ أما الاحتفاظ بها على هذا الجهاز فاختياري. ويستبعد تصدير البيانات الوصفية المخرجات الخام، بينما يتطلب تصدير البيانات الخام الكاملة موافقة صريحة.
أعد استخدام المطالبات الحقيقية نفسها في تقييم لاحق للنموذج من دون إعادة بناء مجموعة المهام.
استخدم مجموعات المهام المحفوظة لجعل المقارنات المستقبلية أكثر اتساقًا، ولإعادة تقييم إصدارات النماذج المحددة بعد إصدار جديد أو تغير في البيانات العامة.
أكمل عناوين المهام ومطالباتها، واختر اسمًا واضحًا لمجموعة المهام، واستخدم المتصفح والجهاز نفسيهما. قد تحتوي مجموعة المهام على نص عمل حساس، لذا أزل البيانات الخاصة قبل الحفظ.
يُخزّن اسم مجموعة المهام والقالب واللغة وعناوين المهام والمطالبات محليًا لإعادة استخدامها. وتبدأ إعادة التقييم جولة نظيفة مع الاحتفاظ بمدخلات الاختبار المقصودة.
لا توجد مجموعات المهام المحفوظة إلا على هذا الجهاز ولا تتم مزامنتها أو نسخها احتياطيًا. لا تُحفظ الإجابات أو اختيارات النماذج أو المراجعات أو التقارير أو مفاتيح API ضمن مجموعة المهام. وقد تؤدي إزالة بيانات الموقع إلى حذف كل المجموعات المحفوظة.
تُبقي OpenGPT المهام وإصدارات النماذج الدقيقة نفسها، ثم تمسح الإجابات والدرجات والأحكام وحالة الكشف والتقرير السابقة، ليكون التشغيل التالي مستقلًا عن النتيجة القديمة.
افحص تقارير JSON المدعومة للتأكد من البنية والاتساق الداخلي وأنماط الأسرار، وأنشئ بصمة محلية.
استخدم أداة التحقق لفحص حزمة OpenGPT Evidence v1 أو v2، أو تقرير V3 منزّل من «مساحة عمل القرار». تُجرى جميع عمليات التحقق محليًا في هذا المتصفح.
احصل على ملف JSON الأصلي. ولتقرير مقارنة، نزّله من مساحة عمل القرار؛ وأكمل جميع الحالات أولًا إذا كنت تحتاج إلى نتيجة مكتملة بدلًا من مسودة.
في Evidence v1/v2، تعني Passed أن الحزمة تتبع قواعد البنية والاتساق المدعومة، بينما تعني Demo أنها مثال. وفي تقرير المقارنة، تعني Passed أن التقرير المكتمل متسق داخليًا؛ وتعني Draft أن بنيته سليمة لكن المقارنة غير مكتملة. وتعني Failed أن فحصًا مطلوبًا واحدًا على الأقل يحتاج إلى مراجعة.
النجاح لا يثبت أن النموذج المسمّى أنتج الإجابات الملصقة، أو أن ادعاءات المزوّد صحيحة، أو أن النتيجة قابلة للتعميم خارج الاختبارات المسجلة. ولا تكون نتائج الملفات غير المرتبطة قابلة للمقارنة تلقائيًا.
لا. إنه يؤكد فقط أن التقرير المدعوم صالح بنيويًا ومتسق داخليًا. ولا يزال عليك تقييم هوية النموذج وجودة الاختبار والمخرجات ومدى صلة القرار.
تعرّف إلى ما يجعل قرار النموذج قابلًا للفحص وإعادة الإنتاج.
استخدم هذه الصفحة قبل تصميم تقييم أو نشره أو الاعتماد عليه. فهي تفصل جودة الأدلة عن شعبية النموذج.
ابدأ بسؤال قرار محدد، وإصدارات نماذج مسماة، ومهام ممثلة، وخطة للاحتفاظ بالمخرجات الخام.
يفحص Evidence v1/v2 التنسيق والتصريحات أساسًا. يدعم مساحة عمل القرار V3 إعادة الحساب محليًا (L3)؛ ولا تزال إعادة الإنتاج المستقلة L4 غير مدعومة.
قد تقلل عملية صارمة التحيز، لكنها لا تضمن أن عينة تمثل كل مستخدم أو لغة أو إصدار مستقبلي أو ظروف إنتاج.
اجعل درجة الصرامة متناسبة مع العواقب. قد تكفي L1 لتجربة شخصية، أما الادعاء العام أو عالي المخاطر فينبغي أن يستند إلى أدلة مستقلة أقوى.
استخدم هذه التعريفات عندما تكون إحدى التسميات غير مألوفة.
راجع المتطلب الذي استبعد كل مرشح، ثم خفف فقط قيدًا مرنًا بالفعل.
متطلبات المراجعةقد يستخدم الناشر مراتب متعادلة أو تهيئات متعددة. وتحافظ OpenGPT على الموضع الأصلي بدل إعادة ترقيم الصفوف الظاهرة.
راجع الترتيبلم ينشر المصدر قيمة قابلة للمقارنة. تتركها OpenGPT غير مُبلّغ عنها بدل معاملتها كصفر؛ ولا تقارن إلا القيم الواقعة ضمن نطاق المعيار المرجعي نفسه.
مراجعة أدلة Agentهذا سجل مصدر مكتمل، وليس حالة لم تُحسم. افتح المصدر الأصلي؛ واستخدم دليل النماذج عندما تحتاج إلى هوية موثقة من المزوّد ووصول رسمي.
مراجعة هوية المصدراستخدم ملف تعريف المتصفح والجهاز نفسيهما. قد يؤدي الوضع الخاص أو حظر التخزين أو مسح بيانات الموقع إلى إزالة القائمة المحلية.
فتح نماذجيتقبل مقارنة البيانات معرّفات نماذج الكتالوج. ربما يكون النموذج نفسه محددًا بالفعل، أو ربما بلغت القائمة حدها الأقصى البالغ أربعة نماذج. اختر إصدارًا آخر من الكتالوج أو أزل مرشحًا أولًا.
فتح دليل النماذجارجع إلى التجربة وأكمل كل مخرج مطلوب لكل إعداد ومهمة، وحالة المراجعة، وفحص الإخفاقات الحرجة، والنتيجة التي أكدها المستخدم.
متابعة Proof Labارجع إلى «المقارنة»، وراجع تحذير المسودة المحلية الأحدث، ثم احتفظ بالمسودة أو أعد تعيينها عن قصد.
مراجعة المسودة المحليةاستخدم بند قائمة التحقق الفاشل لتصحيح سجل المصدر. لا تُدخل أسرارًا ولا تعِد كتابة النتائج.
فتح أداة التحققأبلغ عن رابط معطل أو تفصيل غير صحيح لنموذج أو مشكلة لم تتمكن من حلها.