Segnale dei modelli con chiamata di strumenti · Berkeley Function-Calling Leaderboard
BFCL V4 · Claude-Opus-4-5-20251101 (FC)
Questo risultato BFCL descrive una configurazione del modello e delle chiamate di funzioni, non un prodotto Agent completo né un risultato di idoneità alla produzione.
01
Configurazione
02
Esito
03
Operazione
04
Attendibilità
Nota sulle evidenze
Include tutte le 109 righe del publisher provenienti da un unico CSV V4 fissato. Tutte le righe condividono il commit f7cf735, bfcl-eval 2025.12.17 e la stessa composizione dell’accuratezza complessiva.
Apri l’audit ↗Cosa non dimostra questo risultato
Questo risultato BFCL descrive una configurazione del modello e delle chiamate di funzioni, non un prodotto Agent completo né un risultato di idoneità alla produzione.
Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.
Convalida prima dell’adozione
Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.
- 1
Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.
- 2
Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.
- 3
Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.
- 4
Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.