Signal für Modelle mit Tool-Aufrufen · Berkeley Function-Calling Leaderboard

BFCL V4 · GPT-5-nano-2025-08-07 (FC)

Dieses BFCL-Ergebnis beschreibt eine Modell- und Function-Calling-Konfiguration und weder ein vollständiges Agent-Produkt noch ein Ergebnis zur Produktionsreife.

Gesamtgenauigkeit51.45%
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht

01

Konfiguration

AgentensystemBFCL V4 · GPT-5-nano-2025-08-07 (FC)
BasismodellGPT-5-nano-2025-08-07 (FC)
Quellmodell-ID oder -bezeichnungGPT-5-nano-2025-08-07 (FC)
AgentengerüstBFCL V4 tool-use evaluation
Scaffold-Versionbfcl-eval 2025.12.17
WerkzeugeNative function calling
UmgebungTests zu Function Calling, Websuche, Gedächtnis, Dialogen über mehrere Runden, Halluzinationen und Formatempfindlichkeit
BudgetKategoriespezifisches Protokoll des Herausgebers

02

Ergebnis

Gesamtgenauigkeit51.45%
TeilpunktzahlNicht veröffentlicht
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Gemeldete Benchmark-Kosten8,79 $
Mediane AbschlusszeitNicht veröffentlicht
Menschliches EingreifenNicht veröffentlicht

03

Vorgang

Evidenz aus wiederholten DurchläufenNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht
SicherheitshinweisNicht veröffentlicht
Vergleichbarkeitsgruppebfcl-v4-f7cf735-2025-12-17-overall
Bewertungsdatum
Daten erfasst

04

Vertrauen

NachweisVom Benchmark-Herausgeber gelistet
QuelleBFCL V4
QuellsnapshotBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
Datum der Quelldaten
Von OpenGPT abgerufen
Letzte RankingänderungNoch kein vergleichbarer Verlauf
Zuletzt geprüft
AufgabenNicht veröffentlicht
NachweisstufeVom Herausgeber gepflegt
Nachweishinweis

Enthält alle 109 Herausgeberzeilen aus einer fixierten V4-CSV. Alle Zeilen verwenden Commit f7cf735, bfcl-eval 2025.12.17 und dieselbe Zusammensetzung der Gesamtgenauigkeit.

Audit öffnen

Was dieses Ergebnis nicht nachweist

Dieses BFCL-Ergebnis beschreibt eine Modell- und Function-Calling-Konfiguration und weder ein vollständiges Agent-Produkt noch ein Ergebnis zur Produktionsreife.

Gleiches mit Gleichem vergleichen

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen