Signal für Modelle mit Tool-Aufrufen · Berkeley Function-Calling Leaderboard

BFCL V4 · Grok-4-1-fast-reasoning (FC)

Dieses BFCL-Ergebnis beschreibt eine Modell- und Function-Calling-Konfiguration und weder ein vollständiges Agent-Produkt noch ein Ergebnis zur Produktionsreife.

Gesamtgenauigkeit69.57%
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht

01

Konfiguration

AgentensystemBFCL V4 · Grok-4-1-fast-reasoning (FC)
BasismodellGrok-4-1-fast-reasoning (FC)
Quellmodell-ID oder -bezeichnungGrok-4-1-fast-reasoning (FC)
AgentengerüstBFCL V4 tool-use evaluation
Scaffold-Versionbfcl-eval 2025.12.17
WerkzeugeNative function calling
UmgebungTests zu Function Calling, Websuche, Gedächtnis, Dialogen über mehrere Runden, Halluzinationen und Formatempfindlichkeit
BudgetKategoriespezifisches Protokoll des Herausgebers

02

Ergebnis

Gesamtgenauigkeit69.57%
TeilpunktzahlNicht veröffentlicht
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Gemeldete Benchmark-Kosten17,26 $
Mediane AbschlusszeitNicht veröffentlicht
Menschliches EingreifenNicht veröffentlicht

03

Vorgang

Evidenz aus wiederholten DurchläufenNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht
SicherheitshinweisNicht veröffentlicht
Vergleichbarkeitsgruppebfcl-v4-f7cf735-2025-12-17-overall
Bewertungsdatum
Daten erfasst

04

Vertrauen

NachweisVom Benchmark-Herausgeber gelistet
QuelleBFCL V4
QuellsnapshotBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
Datum der Quelldaten
Von OpenGPT abgerufen
Letzte RankingänderungNoch kein vergleichbarer Verlauf
Zuletzt geprüft
AufgabenNicht veröffentlicht
NachweisstufeVom Herausgeber gepflegt
Nachweishinweis

Enthält alle 109 Herausgeberzeilen aus einer fixierten V4-CSV. Alle Zeilen verwenden Commit f7cf735, bfcl-eval 2025.12.17 und dieselbe Zusammensetzung der Gesamtgenauigkeit.

Audit öffnen

Was dieses Ergebnis nicht nachweist

Dieses BFCL-Ergebnis beschreibt eine Modell- und Function-Calling-Konfiguration und weder ein vollständiges Agent-Produkt noch ein Ergebnis zur Produktionsreife.

Gleiches mit Gleichem vergleichen

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen