مؤشر نماذج استدعاء الأدوات · Berkeley Function-Calling Leaderboard
BFCL V4 · GPT-5.2-2025-12-11 (FC)
تصف نتيجة BFCL هذه نموذجًا وإعدادًا لاستدعاء الدوال، لا منتج وكيل متكاملًا ولا نتيجة جاهزية للإنتاج.
01
الإعداد
02
النتيجة
03
العملية
04
الثقة
ملاحظة الأدلة
يتضمن جميع صفوف الناشر البالغ عددها 109 من ملف V4 CSV مجمّد واحد. وتشترك جميع الصفوف في الالتزام f7cf735 وbfcl-eval 2025.12.17 وتركيبة الدقة الإجمالية نفسها.
فتح التدقيق ↗ما الذي لا تثبته هذه النتيجة
تصف نتيجة BFCL هذه نموذجًا وإعدادًا لاستدعاء الدوال، لا منتج وكيل متكاملًا ولا نتيجة جاهزية للإنتاج.
بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.
تحقّق قبل الاعتماد
تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.
- 1
اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.
- 2
ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.
- 3
نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.
- 4
راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.