منهجية مساحة عمل قرارات الذكاء الاصطناعي

اطّلع على كيفية تحول التوصية إلى قرار.

OpenGPT مساحة عمل لقرارات الذكاء الاصطناعي. وهي تفصل بين مطابقة المتطلبات التحريرية وسجلات المصادر الواقعية وتقييم المهام الواقعية وأدلة المعايير المنشورة، حتى تعرض كل نتيجة شروطها وحدودها.

المنهج في دقيقة واحدة

  • الترتيب نسبي إلى مصدر ونطاق محددين، وليس درجة شاملة.
  • إصدارات النماذج الدقيقة وإعدادات Agent الكاملة هي وحدة المقارنة.
  • تظل البيانات غير المعروفة أو غير المتوافقة غير معروفة بدل تحويلها إلى صفر أو ترتيب موحّد.
  • تثبت فحوص التقارير المحلية البنية والاتساق الداخلي، لا مصدر المخرجات أو أصالة المزوّد.

درجات الملاءمة التحريرية · editorial-fit-v1

كيفية تعيين درجات الملاءمة التحريرية من 0 إلى 10

تدعم مؤشرات الكتالوج الثمانية هذه المقارنة فئةً بفئة. وهي طبقة أحكام تحريرية موثقة من OpenGPT، منفصلة عن نقاط توصية rules-v2 وأدلة المعايير المرجعية العامة.

درجة الملاءمة التحريرية للمنتج: تشير 10 إلى ملاءمة أقوى للبُعد المذكور؛ وتُعرض الأبعاد بالتساوي ولا تُجمع أبدًا في فائز عام.

الذكاء

0–10

ملاءمة تحريرية للعمل العام الواسع والمعقد باستخدام القدرات الموثقة ودور الكتالوج وقيود المنتج المعروفة، لا درجة ذكاء أو معيار.

البرمجة

0–10

ملاءمة تحريرية لتخطيط البرمجيات وتنفيذها وتصحيحها ومراجعتها ومسارات عمل المستودعات؛ وليست معدل اجتياز مقاسًا.

الاستدلال

0–10

ملاءمة تحريرية للتحليل متعدد الخطوات والتعامل مع القيود وحل المشكلات المنظم، لا معيار استدلال أُعيد إنتاجه.

الكتابة

0–10

ملاءمة تحريرية لمسارات عمل الصياغة والتحرير والكتابة الطويلة والتوثيق، لا نتيجة مقاسة للأسلوب أو الدقة الوقائعية.

السرعة

0–10

ملاءمة تحريرية للتكرار السريع بناءً على تموضع المنتج وطريقة تقديمه، لا ادعاءً مقاسًا بزمن الاستجابة.

كفاءة التكلفة

0–10

ملاءمة تحريرية لضبط سعر الوصول وتكلفة التشغيل باستخدام المستويات المدرجة ووضع النشر؛ وليست حسابًا للتكلفة الإجمالية أو ضمانًا للسعر.

التحكم في الخصوصية

0–10

ملاءمة تحريرية للنشر والتحكم في البيانات باستخدام التصنيف المحلي أو الهجين أو السحابي؛ وليست تدقيقًا للأمن أو الامتثال أو القياس عن بُعد.

المنظومة

0–10

ملاءمة تحريرية للأدوات والتكاملات والمنصات وخيارات النشر المتاحة، لا قياسًا للحصة السوقية أو جودة التكامل.

الأوزان والتجميع

يتمتع كل بُعد بالقدر نفسه من البروز في العرض. لا يوجد وزن حسابي أو متوسط أو مجموع درجات أو فائز عام؛ ويقرر المستخدم الأبعاد المهمة للشروط المذكورة.

الحد التحريري البشري

يعيّن المحررون إشارات ملاءمة صحيحة من 0 إلى 10 استنادًا إلى دليل التقييم ومعلومات المنتج المؤكدة من المزوّد وتصنيفات الكتالوج. الدرجة ليست قياسًا لإصدار دقيق أو نتيجة معيار أو احتمالًا أو ضمانًا من المزوّد.

المصادر

تدعم صفحات المزوّد الرسمية الهوية والوصول والإمكانات المنشورة وخيارات النشر والأسعار المُعلنة. أما تسميات OpenGPT بشأن أفضل الاستخدامات ونقاط القوة والضعف والتصنيفات وجميع القيم من 0 إلى 10 فهي مدخلات تحريرية.

مراجعة الكتالوج

آخر مراجعة للكتالوج:

الثقة: تغطية تحريرية متوسطة

تصف الثقة مدى اكتمال تغطية الكتالوج والشرح، لا احتمال الأداء القوي. قد تتغير معلومات المزوّد ولم تُقَس إشارة الملاءمة بصورة مستقلة.

قابلية التطبيق

استخدم الدرجات لمقارنة إدخالات الكتالوج حسب البعد المسمّى في ظل افتراضات المنتج والنشر الحالية. ولا تقارن فروق الدرجات على أنها فروق أداء مقيسة.

قبل الاعتماد، تحقق من معلومات المزوّد الحالية واختبر إصدار النموذج الدقيق ومستوى الخدمة والأدوات والمنطقة والعمل التمثيلي.

الطريقة المنشورة · rules-v2

كيفية إنتاج توصيات OpenGPT

تحوّل أداة الإنشاء ملفًا شخصيًا محليًا إلى قائمة مختصرة حتمية. ترتّب النقاط أدناه ملاءمة المنتجات التحريرية بعد بوابات الميزانية والخصوصية الصارمة؛ ولا تقيس جودة النماذج.

أبعاد التقييم ونقاط القواعد الإضافية

النقاط أوزان مشروطة وليست نسبًا مئوية. تستبعد البوابة الصارمة أي عنصر غير مؤهل قبل احتساب الدرجات.

الملاءمة للمهمة والهدف

Model · Tool

تحصل النماذج على +12 لكل تطابق مع مهمة محددة و+10 للتطابق التام مع الهدف. وتحصل الأدوات على +10 لكل تطابق مع حالة استخدام محددة.

User-declared conditions · OpenGPT editorial catalog

الخصوصية والنشر

Model · Tool

تستبعد الخصوصية المرتفعة النماذج غير المحلية والأدوات غير المصنفة بخصوصية مرتفعة. تحصل النماذج المحلية المؤهلة على +30 وأدوات الخصوصية المرتفعة على +12. وللخصوصية المتوسطة، تحصل النماذج الهجينة/المحلية/السحابية على +8/+5/+2.

User-declared conditions · OpenGPT editorial catalog

أهلية الميزانية

Model · Tool

تُستبعد العناصر الواقعة خارج نطاق السعر المُعلن المحدد. تحصل النماذج المؤهلة على +12 والأدوات على +8؛ ويحصل النموذج ذو الخطة المجانية والمدخل المجاني المُعلن على +16 إضافية.

User-declared conditions · Provider-published facts · OpenGPT editorial catalog

مدى ملاءمة الدور المهني

Model · Tool

تحصل مطابقات نموذج الطالب على +10؛ وتحصل مطابقات أدوار النماذج الأخرى المدعومة على +8. وتحصل مطابقات أداة الطالب على +8؛ وتحصل مطابقات أدوار الأدوات الأخرى المدعومة على +6.

User-declared conditions · OpenGPT editorial catalog

مؤشرات القطاع

Model · Tool

تُربط مصطلحات المجال المعروفة بفئات المهام. تحصل النماذج على +5 والأدوات على +4 لكل تطابق مع مهمة مرتبطة. ولا يُنسخ النص الحر نفسه إلى سير العمل.

User-declared conditions · OpenGPT editorial catalog

مدى ملاءمة اللغة

نموذج

للتفضيل غير الإنجليزي، يحصل تطابق الكتالوج متعدد اللغات على +14 وعدم التطابق على −3. وللإنجليزية، تحصل ملاءمة الكتابة أو التوثيق على +3.

User-declared conditions · OpenGPT editorial catalog

مدى ملاءمة المنصة

Model · Tool

تحصل مطابقة النموذج على Web +3 وDesktop +10 وTerminal +8 وAPI +7 وMobile +9. وتحصل الأدوات على +7 لكل منصة مطابقة أو −3 عند عدم وجود أي تطابق.

User-declared conditions · OpenGPT editorial catalog

ملاءمة الخبرة

Model · Tool

ملاءمة النموذج للمبتدئ تساوي +10، أو −4 عند عدم ملاءمة نموذج محلي؛ وملاءمة المتقدم +7، وملاءمة المستوى المتوسط لنموذج رائد أو هجين +2. أما ملاءمة الأدوات للمبتدئ والمتقدم فتساوي +6 و+5.

User-declared conditions · OpenGPT editorial catalog

الاختيار وحالات التعادل

Model · Tool

يُرتب المرشحون المؤهلون حسب نقاط القواعد، ويُستخدم ترتيب الأسماء عند تساوي الدرجات. تُملأ الأدوار بتسلسل ثابت، وتصبح ثلاثة نماذج إضافية متطابقة كحد أقصى بدائل.

قواعد حتمية v2

حدود المصادر والادعاءات

مصدر وقائعي

حقائق منشورة من المزود

تدعم صفحات المزوّد الرسمية الهوية والوصول وأوصاف الإمكانات المنشورة والأسعار المُعلنة. ولا تتعامل OpenGPT مع هذه الصفحات بوصفها اختبارات أداء مستقلة.

حكم تحريري

كتالوج OpenGPT التحريري

وسوم «الأفضل لـ» ونقاط القوة وتصنيفات الخصوصية والنشر وإشارات ملاءمة المنتجات أحكام تحريرية خضعت للمراجعة. وليست قياسات معيارية أو ضمانات من المزوّد.

شرط يعلنه المستخدم

شروط يعلنها المستخدم

تأتي إشارات الهدف والمهام والدور والميزانية والخصوصية واللغة والمنصة والمهارة والقطاع من ملف المستخدم المحلي. وهي تصف قابلية التطبيق، لا دليلًا خارجيًا.

قاعدة آلية

قواعد حتمية v2

ينتج الملف المطبّع نفسه ولقطة الكتالوج ذاتها الترتيب نفسه. يمكن تفسير الحسابات، لكن الحتمية لا تجعل المدخلات التحريرية حقائق.

للسياق فقط

سياق المعيار العام

تظل التصنيفات العامة أدلة منفصلة. لا يضيف rules-v2 ترتيب المعايير أو درجاتها إلى نقاط التوصية؛ استخدمها بعد إعداد القائمة المختصرة وحافظ على نطاق كل مصدر.

الوقائعي مقابل التحريري

مصدر وقائعي

يجب أن تُرجع الادعاءات الوقائعية إلى مزوّد أو مصدر معيار مسمّى، وإلى هوية دقيقة عند توفرها، وتاريخ مراجعة.

حكم تحريري

وسوم الملاءمة ونقاط القوة والتصنيفات والافتراضات والثقة والتوصيات أحكام تحريرية من OpenGPT. ويجب ألا تُعرض بوصفها نتائج مقاسة لإصدار دقيق.

وتيرة المراجعة والثقة

تُجدول مراجعة المنهجية وسجلات التوصيات النشطة مرة كل 90 يومًا على الأقل، إلى جانب المراجعات المستندة إلى الأحداث. يجب أن تستخدم كل نتيجة تاريخ مراجعة سجلها، لا تاريخ هذه الصفحة.

تُطلق المراجعة عندما

  • يغيّر مزوّد معرّف نموذج أو دورة حياته أو مسار الوصول أو بيان الإمكانات أو السعر المدرج.
  • يتغير محرك التوصية أو الأوزان أو البوابات الصارمة أو التصنيف التحريري.
  • يحدد التصحيح خطأً جوهريًا في المصدر أو الهوية أو السعر أو الخصوصية أو قابلية التطبيق.

قواعد الثقة

تصف الثقة مدى اكتمال شرح الملاءمة والسجل الداعم له. ولا تعبّر عن احتمال أن يقدم النموذج أداءً جيدًا.

مرتفع
توجد الهوية الدقيقة والمصدر الوقائعي الحالي؛ وحُسمت الحقول الجوهرية، والافتراضات ظاهرة، وسُمّي بديل مؤهل.
متوسط
يمكن تفسير المطابقة، لكن مصدرًا أو شرطًا أو حقيقة حالية واحدة تحتاج إلى تأكيد قبل الاعتماد.
منخفض
توجد فجوة جوهرية في الهوية أو الحداثة أو التسعير أو الخصوصية أو قابلية التطبيق. تعامل مع العنصر بوصفه مرشحًا للتحقق فقط.

قابلية التطبيق والشروط

  • ينطبق على القائمة التحريرية المختصرة rules-v2 المولدة من كتالوج النماذج والأدوات الحالي الخاضع للمراجعة.
  • النتيجة مشروطة بالملف المقدّم ولقطة الكتالوج؛ وإذا تغيّر أحدهما فقد تتغير النتيجة.
  • إنه أداة مساعدة لاتخاذ قرارات منخفضة المخاطر، وليس دليلًا على الجودة أو السعر الحالي أو تصدّر المعايير أو السلامة أو المشروعية أو الملاءمة لاستخدام خاضع للتنظيم.

عرض التدقيق المطلوب لكل نتيجة

يجب أن تكشف التوصية المتكاملة الحقول السبعة أدناه كلها دون مطالبة المستخدم باستنتاج حدود الدليل.

  1. لماذا
  2. الأدلة
  3. الافتراضات
  4. آخر مراجعة
  5. الثقة
  6. أفضل بديل
  7. متى لا تختار

من مهمة حقيقية إلى نتيجة قابلة للمراجعة

1

حدد الاختبار

قبل المقارنة، سجّل المهمة ومعايير النجاح والمدخلات والقيود وإصدارات النماذج الدقيقة والإعدادات والتاريخ.

2

استخدم الظروف نفسها

قدّم لكل مرشح المهمة ومعيار التقييم نفسيهما. تقلل التسميات المخفية تحيز الاسم الظاهر، لكن هذا ليس اختبارًا مزدوج التعمية أو مستقل التنفيذ.

3

احتفظ ببيانات المصدر

احفظ المطالبات والإجابات والدرجات والأخطاء وزمن الاستجابة والتجزئات. لا تملأ الأدلة المفقودة بتقديرات.

4

اذكر القيود

اعرض عدم اليقين وحجم العينة والاستبعادات والتعارضات وما لا تثبته النتيجة.

مستويات الأدلة

يفحص Evidence v1/v2 تنسيق الملف والاتساق المعلن. ويعيد مساحة عمل القرار V3 أيضًا حساب التجزئات والتكليفات وعمليات الربط والدرجات والملخصات من المدخلات المحفوظة. ولا يثبت إعادة إنتاج مستقلة عند L4.

L1Supported now

تم فحص التنسيق

يتبع الملف المخطط المعلَن ولا يحتوي على حقول أسرار واضحة.

L2Partially supported

السجل مكتمل

الهدف هو سجل متسق للمهام والإعدادات وإعلانات النماذج وتاريخ التقييم. ولا يفحص V1 سوى جزء من هذا السجل.

L3Supported for V3

قابل لإعادة الاحتساب

يتضمن مساحة عمل القرار V3 المخرجات الخام الملصقة ومدخلات التقييم لإعادة الحساب المحلي الصارمة؛ ولا يحمل Evidence v1/v2 الحقول نفسها.

L4Not yet supported

أُعيد إنتاجه بصورة مستقلة

Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.

كيفية مقارنة تصنيفات Agents في AI

يمثل كل صف إعداد Agent منشورًا واحدًا ضمن نطاق معيار مُسمّى. وليس درجة للنموذج الأساسي وحده.

مقارنة إعدادات النظام

احتفظ معًا بكل حقل نشره المصدر للوكيل والنموذج الأساسي والقالب والأداة والبيئة والميزانية والتاريخ؛ وصنّف الحقول غير المُبلّغ عنها بأنها مجهولة.

حافظ على المقاييس الأصلية

لا ترتّب إلا ضمن المعيار والإصدار وقواعد المهمة ومجموعة التشغيل القابلة للمقارنة نفسها. لا ينشئ OpenGPT درجة عالمية عابرة للمعايير.

حدّد اسم حالة الأدلة

ميّز بين السجلات المدرجة لدى ناشر معيار، والإرسالات المفحوصة من المصدر، وتقارير المزوّد، ومرات التشغيل المجتمعية.

احتفظ بأدلة التشغيل

اعرض التكلفة وزمن الاستجابة والخطوات والتدخل البشري عندما يوفر المصدر قيمًا قابلة للمقارنة؛ واترك القيم المفقودة مجهولة.

ما الذي يمكن أن يثبته التحقق المحلي

  • الحقول المطلوبة وأنواع البيانات المدعومة
  • الاتساق الداخلي للدرجات والتشغيلات والتواريخ وقيم التجزئة
  • ما إذا كانت الحزمة تعلن استخدام بيانات تجريبية
  • خلوّ البيانات من الحقول الشائعة لمفاتيح API والأسرار

ما الذي لا يمكنه إثباته بمفرده

  • أن المزوّد أو النموذج المعلَن عنه أنتج المخرجات فعلًا
  • أن الدرجة خالية من تحيز الاختيار أو ضعف تصميم الاختبار
  • أن نتيجة واحدة تنطبق على كل مهمة أو لغة أو مستخدم أو إصدار مستقبلي للنموذج
  • أن النموذج آمن أو قانوني أو مناسب لقرار عالي المخاطر

مبادئ النشر

لا دفع مقابل الترتيب

يمكن الإفصاح عن الرعاية، لكنها لا تستطيع تغيير احتساب الدرجات أو بوابات الأدلة أو الموضع.

الإصدارات، لا أسماء العلامات التجارية

سلسلة النماذج ليست موضوع اختبار ثابتًا. معرّفات النماذج الدقيقة والإعدادات والمنطقة والتاريخ كلها مهمة.

مهام حقيقية قبل الادعاءات الواسعة

توصي OpenGPT بقوائم مختصرة استنادًا إلى المتطلبات، ثم تطلب من المستخدمين اختبار أعمالهم التمثيلية.

عدم اليقين نتيجة بحد ذاته

ينبغي أن تظل حالات التعادل والعينات الصغيرة والجولات الفاشلة والأدلة غير الحاسمة ظاهرة.