Indicateur de modèle pour l’appel d’outils · Berkeley Function-Calling Leaderboard
BFCL V4 · o3-2025-04-16 (Prompt)
Ce résultat BFCL décrit une configuration de modèle et d’appel de fonctions, et non un produit Agent complet ou une preuve de maturité pour la production.
01
Configuration
02
Résultat obtenu
03
Opération
04
Confiance
Note sur les preuves
Comprend les 109 lignes de l’éditeur provenant d’un même CSV V4 figé. Toutes les lignes partagent le commit f7cf735, bfcl-eval 2025.12.17 et la même composition de la précision globale.
Ouvrir l’audit ↗Ce que ce résultat ne prouve pas
Ce résultat BFCL décrit une configuration de modèle et d’appel de fonctions, et non un produit Agent complet ou une preuve de maturité pour la production.
Données déclarées par la source ; les valeurs manquantes restent inconnues.
Valider avant l’adoption
Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.
- 1
Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.
- 2
Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.
- 3
Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.
- 4
Examinez les échecs et les risques liés au traitement des données avant toute décision de production.