Benchmarks d’Agents
Benchmark d’agents de Berkeley Function-Calling Leaderboard
OpenGPT conserve 109 lignes publiées, associées à la version Berkeley Function-Calling Leaderboard exacte du benchmark et à l’environnement indiqués ci-dessous.
- Tâches
- —
- Lignes publiées
- 109
- Date des données sources
- Identité examinée
- Historique
Périmètre des preuves
BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17. official V4 cases; count not frozen dans this snapshot. Function calling, web search, memory, multi-turn, hallucination, and format tests. Category-specific.
How OpenGPT handles this evidence
OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.
Limites de la comparaison
- Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
- Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
- Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
- OpenGPT inclut les 109 lignes de l’instantané CSV de l’éditeur. Toutes les lignes partagent le commit f7cf735, bfcl-eval 2025.12.17 et la composition officielle de la précision globale V4 ; le coût est l’estimation de l’éditeur pour l’ensemble du benchmark.
BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
Affichage de 24 lignes publiées sur 109. Chaque résultat reste associé au benchmark et à la configuration de sa source.
- BFCL V4 · Claude-Opus-4-5-20251101 (FC)Anthropic · Claude-Opus-4-5-20251101 (FC)#1Overall accuracy: 77.47%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Claude-Sonnet-4-5-20250929 (FC)Anthropic · Claude-Sonnet-4-5-20250929 (FC)#2Overall accuracy: 73.24%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Gemini-3-Pro-Preview (Prompt)Google · Gemini-3-Pro-Preview (Prompt)#3Overall accuracy: 72.51%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · GLM-4.6 (FC thinking)Zhipu AI · GLM-4.6 (FC thinking)#4Overall accuracy: 72.38%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Grok-4-1-fast-reasoning (FC)xAI · Grok-4-1-fast-reasoning (FC)#5Overall accuracy: 69.57%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Claude-Haiku-4-5-20251001 (FC)Anthropic · Claude-Haiku-4-5-20251001 (FC)#6Overall accuracy: 68.70%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Gemini-3-Pro-Preview (FC)Google · Gemini-3-Pro-Preview (FC)#7Overall accuracy: 68.14%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · o3-2025-04-16 (Prompt)OpenAI · o3-2025-04-16 (Prompt)#8Overall accuracy: 63.05%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Grok-4-0709 (Prompt)xAI · Grok-4-0709 (Prompt)#9Overall accuracy: 62.97%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Grok-4-0709 (FC)xAI · Grok-4-0709 (FC)#10Overall accuracy: 61.38%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Moonshotai-Kimi-K2-Instruct (FC)MoonshotAI · Moonshotai-Kimi-K2-Instruct (FC)#11Overall accuracy: 59.06%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Grok-4-1-fast-non-reasoning (FC)xAI · Grok-4-1-fast-non-reasoning (FC)#12Overall accuracy: 58.29%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Command A Reasoning (FC)Cohere · Command A Reasoning (FC)#13Overall accuracy: 57.06%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · DeepSeek-V3.2-Exp (Prompt + Thinking)DeepSeek · DeepSeek-V3.2-Exp (Prompt + Thinking)#14Overall accuracy: 56.73%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Gemini-2.5-Flash (FC)Google · Gemini-2.5-Flash (FC)#15Overall accuracy: 56.24%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · GPT-5.2-2025-12-11 (FC)OpenAI · GPT-5.2-2025-12-11 (FC)#16Overall accuracy: 55.87%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · GPT-5-mini-2025-08-07 (FC)OpenAI · GPT-5-mini-2025-08-07 (FC)#17Overall accuracy: 55.46%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · xLAM-2-32b-fc-r (FC)Salesforce · xLAM-2-32b-fc-r (FC)#18Overall accuracy: 54.66%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · DeepSeek-V3.2-Exp (FC)DeepSeek · DeepSeek-V3.2-Exp (FC)#19Overall accuracy: 54.12%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · GPT-4.1-2025-04-14 (FC)OpenAI · GPT-4.1-2025-04-14 (FC)#20Overall accuracy: 53.96%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · o4-mini-2025-04-16 (FC)OpenAI · o4-mini-2025-04-16 (FC)#21Overall accuracy: 53.24%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · xLAM-2-70b-fc-r (FC)Salesforce · xLAM-2-70b-fc-r (FC)#22Overall accuracy: 53.07%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · Qwen3-235B-A22B-Instruct-2507 (Prompt)Qwen · Qwen3-235B-A22B-Instruct-2507 (Prompt)#23Overall accuracy: 52.15%Évaluation BFCL V4 de l’utilisation d’outils
- BFCL V4 · GPT-5-nano-2025-08-07 (FC)OpenAI · GPT-5-nano-2025-08-07 (FC)#24Overall accuracy: 51.45%Évaluation BFCL V4 de l’utilisation d’outils