Modelsignaal voor toolaanroepen · Berkeley Function-Calling Leaderboard

BFCL V4 · GPT-5-mini-2025-08-07 (FC)

Dit BFCL-resultaat beschrijft een model en configuratie voor functieaanroepen, geen volledig Agent-product van resultaat over productiegereedheid.

Algehele nauwkeurigheid55.46%
Kosten per geslaagde taakNiet gepubliceerd
Bereik van gepubliceerde resultatenNiet gepubliceerd

01

Configuratie

AgentsysteemBFCL V4 · GPT-5-mini-2025-08-07 (FC)
BasismodelGPT-5-mini-2025-08-07 (FC)
Model-ID of label uit bronGPT-5-mini-2025-08-07 (FC)
ScaffoldBFCL V4 tool-use evaluation
Scaffoldversiebfcl-eval 2025.12.17
HulpmiddelenNative function calling
OmgevingTests voor functieaanroepen, zoeken op internet, geheugen, meerdere beurten, hallucinaties en gevoeligheid voor indeling
BudgetCategoriespecifiek protocol van de uitgever

02

Resultaat

Algehele nauwkeurigheid55.46%
Gedeeltelijke scoreNiet gepubliceerd
Kosten per geslaagde taakNiet gepubliceerd
Gerapporteerde benchmarkkostenUS$ 22,18
Mediane voltooiingstijdNiet gepubliceerd
Menselijke tussenkomstNiet gepubliceerd

03

Werking

Bewijs uit herhaalde uitvoeringenNiet gepubliceerd
Bereik van gepubliceerde resultatenNiet gepubliceerd
VeiligheidsnotitieNiet gepubliceerd
Vergelijkbaarheidsgroepbfcl-v4-f7cf735-2025-12-17-overall
Evaluatiedatum
Gegevens vastgelegd

04

Vertrouwen

BewijsVermeld door de benchmarkuitgever
BronBFCL V4
BronmomentopnameBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
Datum van brongegevens
Opgehaald door OpenGPT
Rangschikking laatst gewijzigdNog geen vergelijkbare geschiedenis
Laatst gecontroleerd
TakenNiet gepubliceerd
BewijsniveauOnderhouden door uitgever
Bewijsnotitie

Bevat alle 109 uitgeversrijen uit één bevroren V4-CSV. Alle rijen delen commit f7cf735, bfcl-eval 2025.12.17 en dezelfde samenstelling van de algehele nauwkeurigheid.

Audit openen

Wat dit resultaat niet bewijst

Dit BFCL-resultaat beschrijft een model en configuratie voor functieaanroepen, geen volledig Agent-product van resultaat over productiegereedheid.

Vergelijk vergelijkbare zaken

Alleen configuraties uit dezelfde benchmarkversie en hetzelfde taakbereik kunnen in één vergelijking worden geplaatst.

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.

Valideren vóór ingebruikname

Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt van de configuratie bij uw werk past.

  1. 1

    Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.

  2. 2

    Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.

  3. 3

    Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.

  4. 4

    Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.

Agentoverzicht en -evaluaties