مؤشر نماذج استدعاء الأدوات · Berkeley Function-Calling Leaderboard

BFCL V4 · Grok-4-1-fast-reasoning (FC)

تصف نتيجة BFCL هذه نموذجًا وإعدادًا لاستدعاء الدوال، لا منتج وكيل متكاملًا ولا نتيجة جاهزية للإنتاج.

الدقة الإجمالية69.57%
التكلفة لكل مهمة ناجحةغير منشور
نطاق النتائج المنشورةغير منشور

01

الإعداد

نظام AgentBFCL V4 · Grok-4-1-fast-reasoning (FC)
النموذج الأساسيGrok-4-1-fast-reasoning (FC)
معرّف نموذج المصدر أو تسميتهGrok-4-1-fast-reasoning (FC)
البنيةBFCL V4 tool-use evaluation
إصدار القالب الأوليbfcl-eval 2025.12.17
أدواتNative function calling
البيئةاستدعاء الوظائف والبحث في الويب والذاكرة وتعدد الأدوار والهلوسة واختبارات الحساسية للتنسيق
الميزانيةبروتوكول الناشر الخاص بالفئة

02

النتيجة

الدقة الإجمالية69.57%
درجة جزئيةغير منشور
التكلفة لكل مهمة ناجحةغير منشور
تكلفة المعيار المبلغ عنها‏17.26 US$
الوسيط الزمني للإكمالغير منشور
التدخل البشريغير منشور

03

العملية

أدلة التشغيل المتكررغير منشور
نطاق النتائج المنشورةغير منشور
ملاحظة أمانغير منشور
مجموعة القابلية للمقارنةbfcl-v4-f7cf735-2025-12-17-overall
تاريخ التقييم
البيانات الملتقطة

04

الثقة

الأدلةمدرج لدى ناشر المعيار
المصدرBFCL V4
لقطة المصدرBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
تاريخ بيانات المصدر
استرجعها OpenGPT
آخر تغيير للترتيبلا يوجد سجل قابل للمقارنة بعد
آخر فحص
المهامغير منشور
مستوى الأدلةيتولى الناشر صيانته
ملاحظة الأدلة

يتضمن جميع صفوف الناشر البالغ عددها 109 من ملف V4 CSV مجمّد واحد. وتشترك جميع الصفوف في الالتزام f7cf735 وbfcl-eval 2025.12.17 وتركيبة الدقة الإجمالية نفسها.

فتح التدقيق

ما الذي لا تثبته هذه النتيجة

تصف نتيجة BFCL هذه نموذجًا وإعدادًا لاستدعاء الدوال، لا منتج وكيل متكاملًا ولا نتيجة جاهزية للإنتاج.

قارن المتماثل بالمتماثل

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات