Signal für Modelle mit Tool-Aufrufen · Berkeley Function-Calling Leaderboard
BFCL V4 · DeepSeek-V3.2-Exp (Prompt + Thinking)
Dieses BFCL-Ergebnis beschreibt eine Modell- und Function-Calling-Konfiguration und weder ein vollständiges Agent-Produkt noch ein Ergebnis zur Produktionsreife.
01
Konfiguration
02
Ergebnis
03
Vorgang
04
Vertrauen
Nachweishinweis
Enthält alle 109 Herausgeberzeilen aus einer fixierten V4-CSV. Alle Zeilen verwenden Commit f7cf735, bfcl-eval 2025.12.17 und dieselbe Zusammensetzung der Gesamtgenauigkeit.
Audit öffnen ↗Was dieses Ergebnis nicht nachweist
Dieses BFCL-Ergebnis beschreibt eine Modell- und Function-Calling-Konfiguration und weder ein vollständiges Agent-Produkt noch ein Ergebnis zur Produktionsreife.
Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.
Vor der Einführung validieren
Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.
- 1
Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.
- 2
Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.
- 3
Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.
- 4
Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.