Indicateur de modèle pour l’appel d’outils · Berkeley Function-Calling Leaderboard

BFCL V4 · Gemini-3-Pro-Preview (FC)

Ce résultat BFCL décrit une configuration de modèle et d’appel de fonctions, et non un produit Agent complet ou une preuve de maturité pour la production.

Précision globale68.14%
Coût par tâche réussieNon publié
Plage des résultats publiésNon publié

01

Configuration

Système AgentBFCL V4 · Gemini-3-Pro-Preview (FC)
Modèle de baseGemini-3-Pro-Preview (FC)
ID ou libellé du modèle sourceGemini-3-Pro-Preview (FC)
ÉchafaudageBFCL V4 tool-use evaluation
Version de l’échafaudagebfcl-eval 2025.12.17
OutilsNative function calling
EnvironnementTests d’appel de fonctions, de recherche web, de mémoire, multitours, d’hallucination et de sensibilité au format
BudgetProtocole de l’éditeur propre à la catégorie

02

Résultat obtenu

Précision globale68.14%
Score partielNon publié
Coût par tâche réussieNon publié
Coût de benchmark déclaré224,69 $US
Durée médiane d’achèvementNon publié
Intervention humaineNon publié

03

Opération

Preuves issues d’exécutions répétéesNon publié
Plage des résultats publiésNon publié
Note de sécuritéNon publié
Groupe de comparabilitébfcl-v4-f7cf735-2025-12-17-overall
Date de l’évaluation
Données saisies

04

Confiance

PreuvesRépertorié par l’éditeur du benchmark
SourceBFCL V4
Instantané de la sourceBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
Date des données sources
Récupéré par OpenGPT
Dernière modification du classementAucun historique comparable pour l’instant
Dernière vérification
TâchesNon publié
Niveau de preuveMaintenu par l’éditeur
Note sur les preuves

Comprend les 109 lignes de l’éditeur provenant d’un même CSV V4 figé. Toutes les lignes partagent le commit f7cf735, bfcl-eval 2025.12.17 et la même composition de la précision globale.

Ouvrir l’audit

Ce que ce résultat ne prouve pas

Ce résultat BFCL décrit une configuration de modèle et d’appel de fonctions, et non un produit Agent complet ou une preuve de maturité pour la production.

Comparer ce qui est comparable

Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.

Données déclarées par la source ; les valeurs manquantes restent inconnues.

Valider avant l’adoption

Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.

  1. 1

    Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.

  2. 2

    Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.

  3. 3

    Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.

  4. 4

    Examinez les échecs et les risques liés au traitement des données avant toute décision de production.

Annuaire et évaluations des Agents