معايير Agent

معيار وكلاء Berkeley Function-Calling Leaderboard

تُبقي OpenGPT عدد 109 من الصفوف المنشورة مرتبطًا بإصدار المعيار Berkeley Function-Calling Leaderboard الدقيق والبيئة الموضحة أدناه.

المهام
صفوف منشورة
109
تاريخ بيانات المصدر
تمت مراجعة الهوية
تاريخي

نطاق الأدلة

BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17. official V4 cases; count not frozen في this snapshot. Function calling, web search, memory, multi-turn, hallucination, and format tests. Category-specific.

How OpenGPT handles this evidence

تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.

حدود المقارنة

  • تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
  • تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
  • تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
  • تتضمن OpenGPT جميع الصفوف البالغ عددها 109 من لقطة CSV للناشر. وتشترك جميعها في الالتزام f7cf735 وbfcl-eval 2025.12.17 وتركيبة الدقة الإجمالية الرسمية لـ V4؛ والتكلفة هي تقدير الناشر للمعيار الكامل.

BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17

عرض 24 من أصل 109 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.

  1. BFCL V4 · Claude-Opus-4-5-20251101 (FC)Anthropic · Claude-Opus-4-5-20251101 (FC)#1Overall accuracy: 77.47%تقييم استخدام الأدوات BFCL V4
  2. BFCL V4 · Claude-Sonnet-4-5-20250929 (FC)Anthropic · Claude-Sonnet-4-5-20250929 (FC)#2Overall accuracy: 73.24%تقييم استخدام الأدوات BFCL V4
  3. BFCL V4 · Gemini-3-Pro-Preview (Prompt)Google · Gemini-3-Pro-Preview (Prompt)#3Overall accuracy: 72.51%تقييم استخدام الأدوات BFCL V4
  4. BFCL V4 · GLM-4.6 (FC thinking)Zhipu AI · GLM-4.6 (FC thinking)#4Overall accuracy: 72.38%تقييم استخدام الأدوات BFCL V4
  5. BFCL V4 · Grok-4-1-fast-reasoning (FC)xAI · Grok-4-1-fast-reasoning (FC)#5Overall accuracy: 69.57%تقييم استخدام الأدوات BFCL V4
  6. BFCL V4 · Claude-Haiku-4-5-20251001 (FC)Anthropic · Claude-Haiku-4-5-20251001 (FC)#6Overall accuracy: 68.70%تقييم استخدام الأدوات BFCL V4
  7. BFCL V4 · Gemini-3-Pro-Preview (FC)Google · Gemini-3-Pro-Preview (FC)#7Overall accuracy: 68.14%تقييم استخدام الأدوات BFCL V4
  8. BFCL V4 · o3-2025-04-16 (Prompt)OpenAI · o3-2025-04-16 (Prompt)#8Overall accuracy: 63.05%تقييم استخدام الأدوات BFCL V4
  9. BFCL V4 · Grok-4-0709 (Prompt)xAI · Grok-4-0709 (Prompt)#9Overall accuracy: 62.97%تقييم استخدام الأدوات BFCL V4
  10. BFCL V4 · Grok-4-0709 (FC)xAI · Grok-4-0709 (FC)#10Overall accuracy: 61.38%تقييم استخدام الأدوات BFCL V4
  11. BFCL V4 · Moonshotai-Kimi-K2-Instruct (FC)MoonshotAI · Moonshotai-Kimi-K2-Instruct (FC)#11Overall accuracy: 59.06%تقييم استخدام الأدوات BFCL V4
  12. BFCL V4 · Grok-4-1-fast-non-reasoning (FC)xAI · Grok-4-1-fast-non-reasoning (FC)#12Overall accuracy: 58.29%تقييم استخدام الأدوات BFCL V4
  13. BFCL V4 · Command A Reasoning (FC)Cohere · Command A Reasoning (FC)#13Overall accuracy: 57.06%تقييم استخدام الأدوات BFCL V4
  14. BFCL V4 · DeepSeek-V3.2-Exp (Prompt + Thinking)DeepSeek · DeepSeek-V3.2-Exp (Prompt + Thinking)#14Overall accuracy: 56.73%تقييم استخدام الأدوات BFCL V4
  15. BFCL V4 · Gemini-2.5-Flash (FC)Google · Gemini-2.5-Flash (FC)#15Overall accuracy: 56.24%تقييم استخدام الأدوات BFCL V4
  16. BFCL V4 · GPT-5.2-2025-12-11 (FC)OpenAI · GPT-5.2-2025-12-11 (FC)#16Overall accuracy: 55.87%تقييم استخدام الأدوات BFCL V4
  17. BFCL V4 · GPT-5-mini-2025-08-07 (FC)OpenAI · GPT-5-mini-2025-08-07 (FC)#17Overall accuracy: 55.46%تقييم استخدام الأدوات BFCL V4
  18. BFCL V4 · xLAM-2-32b-fc-r (FC)Salesforce · xLAM-2-32b-fc-r (FC)#18Overall accuracy: 54.66%تقييم استخدام الأدوات BFCL V4
  19. BFCL V4 · DeepSeek-V3.2-Exp (FC)DeepSeek · DeepSeek-V3.2-Exp (FC)#19Overall accuracy: 54.12%تقييم استخدام الأدوات BFCL V4
  20. BFCL V4 · GPT-4.1-2025-04-14 (FC)OpenAI · GPT-4.1-2025-04-14 (FC)#20Overall accuracy: 53.96%تقييم استخدام الأدوات BFCL V4
  21. BFCL V4 · o4-mini-2025-04-16 (FC)OpenAI · o4-mini-2025-04-16 (FC)#21Overall accuracy: 53.24%تقييم استخدام الأدوات BFCL V4
  22. BFCL V4 · xLAM-2-70b-fc-r (FC)Salesforce · xLAM-2-70b-fc-r (FC)#22Overall accuracy: 53.07%تقييم استخدام الأدوات BFCL V4
  23. BFCL V4 · Qwen3-235B-A22B-Instruct-2507 (Prompt)Qwen · Qwen3-235B-A22B-Instruct-2507 (Prompt)#23Overall accuracy: 52.15%تقييم استخدام الأدوات BFCL V4
  24. BFCL V4 · GPT-5-nano-2025-08-07 (FC)OpenAI · GPT-5-nano-2025-08-07 (FC)#24Overall accuracy: 51.45%تقييم استخدام الأدوات BFCL V4