اطّلع على كيفية تحول التوصية إلى قرار.
OpenGPT مساحة عمل لقرارات الذكاء الاصطناعي. وهي تفصل بين مطابقة المتطلبات التحريرية وسجلات المصادر الواقعية وتقييم المهام الواقعية وأدلة المعايير المنشورة، حتى تعرض كل نتيجة شروطها وحدودها.
المنهج في دقيقة واحدة
- الترتيب نسبي إلى مصدر ونطاق محددين، وليس درجة شاملة.
- إصدارات النماذج الدقيقة وإعدادات Agent الكاملة هي وحدة المقارنة.
- تظل البيانات غير المعروفة أو غير المتوافقة غير معروفة بدل تحويلها إلى صفر أو ترتيب موحّد.
- تثبت فحوص التقارير المحلية البنية والاتساق الداخلي، لا مصدر المخرجات أو أصالة المزوّد.
درجات الملاءمة التحريرية · editorial-fit-v1
كيفية تعيين درجات الملاءمة التحريرية من 0 إلى 10
تدعم مؤشرات الكتالوج الثمانية هذه المقارنة فئةً بفئة. وهي طبقة أحكام تحريرية موثقة من OpenGPT، منفصلة عن نقاط توصية rules-v2 وأدلة المعايير المرجعية العامة.
درجة الملاءمة التحريرية للمنتج: تشير 10 إلى ملاءمة أقوى للبُعد المذكور؛ وتُعرض الأبعاد بالتساوي ولا تُجمع أبدًا في فائز عام.
الذكاء
0–10ملاءمة تحريرية للعمل العام الواسع والمعقد باستخدام القدرات الموثقة ودور الكتالوج وقيود المنتج المعروفة، لا درجة ذكاء أو معيار.
البرمجة
0–10ملاءمة تحريرية لتخطيط البرمجيات وتنفيذها وتصحيحها ومراجعتها ومسارات عمل المستودعات؛ وليست معدل اجتياز مقاسًا.
الاستدلال
0–10ملاءمة تحريرية للتحليل متعدد الخطوات والتعامل مع القيود وحل المشكلات المنظم، لا معيار استدلال أُعيد إنتاجه.
الكتابة
0–10ملاءمة تحريرية لمسارات عمل الصياغة والتحرير والكتابة الطويلة والتوثيق، لا نتيجة مقاسة للأسلوب أو الدقة الوقائعية.
السرعة
0–10ملاءمة تحريرية للتكرار السريع بناءً على تموضع المنتج وطريقة تقديمه، لا ادعاءً مقاسًا بزمن الاستجابة.
كفاءة التكلفة
0–10ملاءمة تحريرية لضبط سعر الوصول وتكلفة التشغيل باستخدام المستويات المدرجة ووضع النشر؛ وليست حسابًا للتكلفة الإجمالية أو ضمانًا للسعر.
التحكم في الخصوصية
0–10ملاءمة تحريرية للنشر والتحكم في البيانات باستخدام التصنيف المحلي أو الهجين أو السحابي؛ وليست تدقيقًا للأمن أو الامتثال أو القياس عن بُعد.
المنظومة
0–10ملاءمة تحريرية للأدوات والتكاملات والمنصات وخيارات النشر المتاحة، لا قياسًا للحصة السوقية أو جودة التكامل.
الأوزان والتجميع
يتمتع كل بُعد بالقدر نفسه من البروز في العرض. لا يوجد وزن حسابي أو متوسط أو مجموع درجات أو فائز عام؛ ويقرر المستخدم الأبعاد المهمة للشروط المذكورة.
الحد التحريري البشري
يعيّن المحررون إشارات ملاءمة صحيحة من 0 إلى 10 استنادًا إلى دليل التقييم ومعلومات المنتج المؤكدة من المزوّد وتصنيفات الكتالوج. الدرجة ليست قياسًا لإصدار دقيق أو نتيجة معيار أو احتمالًا أو ضمانًا من المزوّد.
المصادر
تدعم صفحات المزوّد الرسمية الهوية والوصول والإمكانات المنشورة وخيارات النشر والأسعار المُعلنة. أما تسميات OpenGPT بشأن أفضل الاستخدامات ونقاط القوة والضعف والتصنيفات وجميع القيم من 0 إلى 10 فهي مدخلات تحريرية.
مراجعة الكتالوج
آخر مراجعة للكتالوج:
الثقة: تغطية تحريرية متوسطة
تصف الثقة مدى اكتمال تغطية الكتالوج والشرح، لا احتمال الأداء القوي. قد تتغير معلومات المزوّد ولم تُقَس إشارة الملاءمة بصورة مستقلة.
قابلية التطبيق
استخدم الدرجات لمقارنة إدخالات الكتالوج حسب البعد المسمّى في ظل افتراضات المنتج والنشر الحالية. ولا تقارن فروق الدرجات على أنها فروق أداء مقيسة.
قبل الاعتماد، تحقق من معلومات المزوّد الحالية واختبر إصدار النموذج الدقيق ومستوى الخدمة والأدوات والمنطقة والعمل التمثيلي.
الطريقة المنشورة · rules-v2
كيفية إنتاج توصيات OpenGPT
تحوّل أداة الإنشاء ملفًا شخصيًا محليًا إلى قائمة مختصرة حتمية. ترتّب النقاط أدناه ملاءمة المنتجات التحريرية بعد بوابات الميزانية والخصوصية الصارمة؛ ولا تقيس جودة النماذج.
أبعاد التقييم ونقاط القواعد الإضافية
النقاط أوزان مشروطة وليست نسبًا مئوية. تستبعد البوابة الصارمة أي عنصر غير مؤهل قبل احتساب الدرجات.
الملاءمة للمهمة والهدف
Model · Toolتحصل النماذج على +12 لكل تطابق مع مهمة محددة و+10 للتطابق التام مع الهدف. وتحصل الأدوات على +10 لكل تطابق مع حالة استخدام محددة.
User-declared conditions · OpenGPT editorial catalogالخصوصية والنشر
Model · Toolتستبعد الخصوصية المرتفعة النماذج غير المحلية والأدوات غير المصنفة بخصوصية مرتفعة. تحصل النماذج المحلية المؤهلة على +30 وأدوات الخصوصية المرتفعة على +12. وللخصوصية المتوسطة، تحصل النماذج الهجينة/المحلية/السحابية على +8/+5/+2.
User-declared conditions · OpenGPT editorial catalogأهلية الميزانية
Model · Toolتُستبعد العناصر الواقعة خارج نطاق السعر المُعلن المحدد. تحصل النماذج المؤهلة على +12 والأدوات على +8؛ ويحصل النموذج ذو الخطة المجانية والمدخل المجاني المُعلن على +16 إضافية.
User-declared conditions · Provider-published facts · OpenGPT editorial catalogمدى ملاءمة الدور المهني
Model · Toolتحصل مطابقات نموذج الطالب على +10؛ وتحصل مطابقات أدوار النماذج الأخرى المدعومة على +8. وتحصل مطابقات أداة الطالب على +8؛ وتحصل مطابقات أدوار الأدوات الأخرى المدعومة على +6.
User-declared conditions · OpenGPT editorial catalogمؤشرات القطاع
Model · Toolتُربط مصطلحات المجال المعروفة بفئات المهام. تحصل النماذج على +5 والأدوات على +4 لكل تطابق مع مهمة مرتبطة. ولا يُنسخ النص الحر نفسه إلى سير العمل.
User-declared conditions · OpenGPT editorial catalogمدى ملاءمة اللغة
نموذجللتفضيل غير الإنجليزي، يحصل تطابق الكتالوج متعدد اللغات على +14 وعدم التطابق على −3. وللإنجليزية، تحصل ملاءمة الكتابة أو التوثيق على +3.
User-declared conditions · OpenGPT editorial catalogمدى ملاءمة المنصة
Model · Toolتحصل مطابقة النموذج على Web +3 وDesktop +10 وTerminal +8 وAPI +7 وMobile +9. وتحصل الأدوات على +7 لكل منصة مطابقة أو −3 عند عدم وجود أي تطابق.
User-declared conditions · OpenGPT editorial catalogملاءمة الخبرة
Model · Toolملاءمة النموذج للمبتدئ تساوي +10، أو −4 عند عدم ملاءمة نموذج محلي؛ وملاءمة المتقدم +7، وملاءمة المستوى المتوسط لنموذج رائد أو هجين +2. أما ملاءمة الأدوات للمبتدئ والمتقدم فتساوي +6 و+5.
User-declared conditions · OpenGPT editorial catalogالاختيار وحالات التعادل
Model · Toolيُرتب المرشحون المؤهلون حسب نقاط القواعد، ويُستخدم ترتيب الأسماء عند تساوي الدرجات. تُملأ الأدوار بتسلسل ثابت، وتصبح ثلاثة نماذج إضافية متطابقة كحد أقصى بدائل.
قواعد حتمية v2حدود المصادر والادعاءات
حقائق منشورة من المزود
تدعم صفحات المزوّد الرسمية الهوية والوصول وأوصاف الإمكانات المنشورة والأسعار المُعلنة. ولا تتعامل OpenGPT مع هذه الصفحات بوصفها اختبارات أداء مستقلة.
كتالوج OpenGPT التحريري
وسوم «الأفضل لـ» ونقاط القوة وتصنيفات الخصوصية والنشر وإشارات ملاءمة المنتجات أحكام تحريرية خضعت للمراجعة. وليست قياسات معيارية أو ضمانات من المزوّد.
شروط يعلنها المستخدم
تأتي إشارات الهدف والمهام والدور والميزانية والخصوصية واللغة والمنصة والمهارة والقطاع من ملف المستخدم المحلي. وهي تصف قابلية التطبيق، لا دليلًا خارجيًا.
قواعد حتمية v2
ينتج الملف المطبّع نفسه ولقطة الكتالوج ذاتها الترتيب نفسه. يمكن تفسير الحسابات، لكن الحتمية لا تجعل المدخلات التحريرية حقائق.
سياق المعيار العام
تظل التصنيفات العامة أدلة منفصلة. لا يضيف rules-v2 ترتيب المعايير أو درجاتها إلى نقاط التوصية؛ استخدمها بعد إعداد القائمة المختصرة وحافظ على نطاق كل مصدر.
الوقائعي مقابل التحريري
يجب أن تُرجع الادعاءات الوقائعية إلى مزوّد أو مصدر معيار مسمّى، وإلى هوية دقيقة عند توفرها، وتاريخ مراجعة.
وسوم الملاءمة ونقاط القوة والتصنيفات والافتراضات والثقة والتوصيات أحكام تحريرية من OpenGPT. ويجب ألا تُعرض بوصفها نتائج مقاسة لإصدار دقيق.
وتيرة المراجعة والثقة
تُجدول مراجعة المنهجية وسجلات التوصيات النشطة مرة كل 90 يومًا على الأقل، إلى جانب المراجعات المستندة إلى الأحداث. يجب أن تستخدم كل نتيجة تاريخ مراجعة سجلها، لا تاريخ هذه الصفحة.
تُطلق المراجعة عندما
- يغيّر مزوّد معرّف نموذج أو دورة حياته أو مسار الوصول أو بيان الإمكانات أو السعر المدرج.
- يتغير محرك التوصية أو الأوزان أو البوابات الصارمة أو التصنيف التحريري.
- يحدد التصحيح خطأً جوهريًا في المصدر أو الهوية أو السعر أو الخصوصية أو قابلية التطبيق.
قواعد الثقة
تصف الثقة مدى اكتمال شرح الملاءمة والسجل الداعم له. ولا تعبّر عن احتمال أن يقدم النموذج أداءً جيدًا.
- مرتفع
- توجد الهوية الدقيقة والمصدر الوقائعي الحالي؛ وحُسمت الحقول الجوهرية، والافتراضات ظاهرة، وسُمّي بديل مؤهل.
- متوسط
- يمكن تفسير المطابقة، لكن مصدرًا أو شرطًا أو حقيقة حالية واحدة تحتاج إلى تأكيد قبل الاعتماد.
- منخفض
- توجد فجوة جوهرية في الهوية أو الحداثة أو التسعير أو الخصوصية أو قابلية التطبيق. تعامل مع العنصر بوصفه مرشحًا للتحقق فقط.
قابلية التطبيق والشروط
- ينطبق على القائمة التحريرية المختصرة rules-v2 المولدة من كتالوج النماذج والأدوات الحالي الخاضع للمراجعة.
- النتيجة مشروطة بالملف المقدّم ولقطة الكتالوج؛ وإذا تغيّر أحدهما فقد تتغير النتيجة.
- إنه أداة مساعدة لاتخاذ قرارات منخفضة المخاطر، وليس دليلًا على الجودة أو السعر الحالي أو تصدّر المعايير أو السلامة أو المشروعية أو الملاءمة لاستخدام خاضع للتنظيم.
عرض التدقيق المطلوب لكل نتيجة
يجب أن تكشف التوصية المتكاملة الحقول السبعة أدناه كلها دون مطالبة المستخدم باستنتاج حدود الدليل.
- لماذا
- الأدلة
- الافتراضات
- آخر مراجعة
- الثقة
- أفضل بديل
- متى لا تختار
من مهمة حقيقية إلى نتيجة قابلة للمراجعة
حدد الاختبار
قبل المقارنة، سجّل المهمة ومعايير النجاح والمدخلات والقيود وإصدارات النماذج الدقيقة والإعدادات والتاريخ.
استخدم الظروف نفسها
قدّم لكل مرشح المهمة ومعيار التقييم نفسيهما. تقلل التسميات المخفية تحيز الاسم الظاهر، لكن هذا ليس اختبارًا مزدوج التعمية أو مستقل التنفيذ.
احتفظ ببيانات المصدر
احفظ المطالبات والإجابات والدرجات والأخطاء وزمن الاستجابة والتجزئات. لا تملأ الأدلة المفقودة بتقديرات.
اذكر القيود
اعرض عدم اليقين وحجم العينة والاستبعادات والتعارضات وما لا تثبته النتيجة.
مستويات الأدلة
يفحص Evidence v1/v2 تنسيق الملف والاتساق المعلن. ويعيد مساحة عمل القرار V3 أيضًا حساب التجزئات والتكليفات وعمليات الربط والدرجات والملخصات من المدخلات المحفوظة. ولا يثبت إعادة إنتاج مستقلة عند L4.
تم فحص التنسيق
يتبع الملف المخطط المعلَن ولا يحتوي على حقول أسرار واضحة.
السجل مكتمل
الهدف هو سجل متسق للمهام والإعدادات وإعلانات النماذج وتاريخ التقييم. ولا يفحص V1 سوى جزء من هذا السجل.
قابل لإعادة الاحتساب
يتضمن مساحة عمل القرار V3 المخرجات الخام الملصقة ومدخلات التقييم لإعادة الحساب المحلي الصارمة؛ ولا يحمل Evidence v1/v2 الحقول نفسها.
أُعيد إنتاجه بصورة مستقلة
Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.
كيفية مقارنة تصنيفات Agents في AI
يمثل كل صف إعداد Agent منشورًا واحدًا ضمن نطاق معيار مُسمّى. وليس درجة للنموذج الأساسي وحده.
مقارنة إعدادات النظام
احتفظ معًا بكل حقل نشره المصدر للوكيل والنموذج الأساسي والقالب والأداة والبيئة والميزانية والتاريخ؛ وصنّف الحقول غير المُبلّغ عنها بأنها مجهولة.
حافظ على المقاييس الأصلية
لا ترتّب إلا ضمن المعيار والإصدار وقواعد المهمة ومجموعة التشغيل القابلة للمقارنة نفسها. لا ينشئ OpenGPT درجة عالمية عابرة للمعايير.
حدّد اسم حالة الأدلة
ميّز بين السجلات المدرجة لدى ناشر معيار، والإرسالات المفحوصة من المصدر، وتقارير المزوّد، ومرات التشغيل المجتمعية.
احتفظ بأدلة التشغيل
اعرض التكلفة وزمن الاستجابة والخطوات والتدخل البشري عندما يوفر المصدر قيمًا قابلة للمقارنة؛ واترك القيم المفقودة مجهولة.
ما الذي يمكن أن يثبته التحقق المحلي
- ✓الحقول المطلوبة وأنواع البيانات المدعومة
- ✓الاتساق الداخلي للدرجات والتشغيلات والتواريخ وقيم التجزئة
- ✓ما إذا كانت الحزمة تعلن استخدام بيانات تجريبية
- ✓خلوّ البيانات من الحقول الشائعة لمفاتيح API والأسرار
ما الذي لا يمكنه إثباته بمفرده
- —أن المزوّد أو النموذج المعلَن عنه أنتج المخرجات فعلًا
- —أن الدرجة خالية من تحيز الاختيار أو ضعف تصميم الاختبار
- —أن نتيجة واحدة تنطبق على كل مهمة أو لغة أو مستخدم أو إصدار مستقبلي للنموذج
- —أن النموذج آمن أو قانوني أو مناسب لقرار عالي المخاطر
مبادئ النشر
لا دفع مقابل الترتيب
يمكن الإفصاح عن الرعاية، لكنها لا تستطيع تغيير احتساب الدرجات أو بوابات الأدلة أو الموضع.
الإصدارات، لا أسماء العلامات التجارية
سلسلة النماذج ليست موضوع اختبار ثابتًا. معرّفات النماذج الدقيقة والإعدادات والمنطقة والتاريخ كلها مهمة.
مهام حقيقية قبل الادعاءات الواسعة
توصي OpenGPT بقوائم مختصرة استنادًا إلى المتطلبات، ثم تطلب من المستخدمين اختبار أعمالهم التمثيلية.
عدم اليقين نتيجة بحد ذاته
ينبغي أن تظل حالات التعادل والعينات الصغيرة والجولات الفاشلة والأدلة غير الحاسمة ظاهرة.