Segnale dei modelli con chiamata di strumenti · Berkeley Function-Calling Leaderboard

BFCL V4 · xLAM-2-70b-fc-r (FC)

Questo risultato BFCL descrive una configurazione del modello e delle chiamate di funzioni, non un prodotto Agent completo né un risultato di idoneità alla produzione.

Accuratezza complessiva53.07%
Costo per attività riuscitaNon pubblicato
Intervallo dei risultati pubblicatiNon pubblicato

01

Configurazione

Sistema AgentBFCL V4 · xLAM-2-70b-fc-r (FC)
Modello di basexLAM-2-70b-fc-r (FC)
ID o etichetta del modello della fontexLAM-2-70b-fc-r (FC)
ScaffoldBFCL V4 tool-use evaluation
Versione dello scaffoldbfcl-eval 2025.12.17
StrumentiNative function calling
AmbienteChiamate di funzione, ricerca sul web, memoria, multi-turno, allucinazioni e test di sensibilità al formato
BudgetProtocollo del publisher specifico per la categoria

02

Esito

Accuratezza complessiva53.07%
Punteggio parzialeNon pubblicato
Costo per attività riuscitaNon pubblicato
Costo di benchmark indicato25,1 USD
Tempo mediano di completamentoNon pubblicato
Intervento umanoNon pubblicato

03

Operazione

Evidenze delle esecuzioni ripetuteNon pubblicato
Intervallo dei risultati pubblicatiNon pubblicato
Nota sulla sicurezzaNon pubblicato
Gruppo di comparabilitàbfcl-v4-f7cf735-2025-12-17-overall
Data della valutazione
Dati acquisiti

04

Attendibilità

EvidenzeElencato dal publisher del benchmark
FonteBFCL V4
Istantanea della fonteBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
Data dei dati della fonte
Recuperato da OpenGPT
Ultima modifica della classificaAncora nessuna cronologia comparabile
Ultimo controllo
AttivitàNon pubblicato
Livello delle evidenzeGestito dal publisher
Nota sulle evidenze

Include tutte le 109 righe del publisher provenienti da un unico CSV V4 fissato. Tutte le righe condividono il commit f7cf735, bfcl-eval 2025.12.17 e la stessa composizione dell’accuratezza complessiva.

Apri l’audit

Cosa non dimostra questo risultato

Questo risultato BFCL descrive una configurazione del modello e delle chiamate di funzioni, non un prodotto Agent completo né un risultato di idoneità alla produzione.

Confronta elementi omogenei

Soltanto configurazioni della stessa versione del benchmark e dello stesso ambito di attività possono essere inserite in un unico confronto.

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.

Convalida prima dell’adozione

Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.

  1. 1

    Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.

  2. 2

    Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.

  3. 3

    Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.

  4. 4

    Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.

Directory e valutazioni degli Agent