تكوين Agent · GAIA

HF Open Deep Research · GPT-5 Medium (August 2025)

العنصر المرتّب: النموذج والبنية التوجيهية والأدوات والأذونات والميزانية والبيئة معًا.

الدقة62.80%
التكلفة لكل مهمة ناجحة‏3.47 US$
نطاق النتائج المنشورةغير منشور

01

الإعداد

نظام AgentHF Open Deep Research · GPT-5 Medium (August 2025)
النموذج الأساسيGPT-5 Medium (August 2025)
معرّف نموذج المصدر أو تسميتهGPT-5 Medium (August 2025)
البنيةHF Open Deep Research
إصدار القالب الأوليغير مُبلّغ عنه
أدواتغير مُبلّغ عنه
البيئةمهام مساعد عام تتطلب الاستدلال وتعدد الوسائط والتصفح والأدوات
الميزانيةخاص بالمصدر · لم يُنشر حد موحّد للخطوات أو الرموز المميزة

02

النتيجة

الدقة62.80%
درجة جزئيةغير منشور
التكلفة لكل مهمة ناجحة‏3.47 US$
تكلفة المعيار المبلغ عنها‏359.83 US$
الوسيط الزمني للإكمالغير منشور
التدخل البشريغير منشور

03

العملية

أدلة التشغيل المتكرر1 من عمليات التشغيل
نطاق النتائج المنشورةغير منشور
ملاحظة أمانغير منشور
مجموعة القابلية للمقارنةhal-gaia-public-validation-165
تاريخ التقييمغير منشور
البيانات الملتقطة

04

الثقة

الأدلةسجل تشغيل عام مكتمل
المصدرHolistic Agent Leaderboard · GAIA
لقطة المصدرلقطة HAL متحقق منها · مجموعة تحقق عامة · 165 سؤالًا
تاريخ بيانات المصدرلم ينشره المصدر
استرجعها OpenGPT
آخر تغيير للترتيبلا يوجد سجل قابل للمقارنة بعد
آخر فحص
المهام165 أسئلة التحقق العامة
مستوى الأدلةتنبيه خارجي
ملاحظة الأدلة

أعاد HAL إنتاج صفوف التحقق العامة هذه وينشر البنية والنموذج والدرجة والتكلفة وعدد مرات التشغيل والمسارات. تعامل مع اللقطة بوصفها تاريخية؛ ولا تُنشر ميزانية أدوات أو خطوات موحدة.

فتح التدقيق

ما الذي لا تثبته هذه النتيجة

تنطبق هذه النتيجة على النظام المحدد وظروف المصدر المعروضة هنا فحسب. ولا تثبت وجود وكيل هو الأفضل عالميًا، أو موثوقية في بيئة الإنتاج، أو حوكمة للبيانات، أو أداءً على إصدار مختلف من المعيار المرجعي.

قارن المتماثل بالمتماثل

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات