Señal del modelo para llamadas a herramientas · Berkeley Function-Calling Leaderboard

BFCL V4 · Claude-Opus-4-5-20251101 (FC)

Este resultado de BFCL describe un modelo y una configuración de llamadas a funciones, no un producto Agent completo ni un resultado sobre su idoneidad para producción.

Exactitud general77.47%
Coste por tarea completada con éxitoNo publicado
Intervalo de resultados publicadosNo publicado

01

Configuración

Sistema AgentBFCL V4 · Claude-Opus-4-5-20251101 (FC)
Modelo baseClaude-Opus-4-5-20251101 (FC)
ID o etiqueta del modelo en la fuenteClaude-Opus-4-5-20251101 (FC)
AndamiajeBFCL V4 tool-use evaluation
Versión del andamiajebfcl-eval 2025.12.17
HerramientasNative function calling
EntornoPruebas de llamada a funciones, búsqueda web, memoria, varios turnos, alucinaciones y sensibilidad al formato
PresupuestoProtocolo del editor específico de la categoría

02

Resultado

Exactitud general77.47%
Puntuación parcialNo publicado
Coste por tarea completada con éxitoNo publicado
Coste comunicado de la prueba de referencia86,55 US$
Mediana del tiempo de finalizaciónNo publicado
Intervención humanaNo publicado

03

Operación

Pruebas de ejecuciones repetidasNo publicado
Intervalo de resultados publicadosNo publicado
Nota de seguridadNo publicado
Grupo de comparabilidadbfcl-v4-f7cf735-2025-12-17-overall
Fecha de evaluación
Datos capturados

04

Confianza

EvidenciaIncluido por el editor del benchmark
FuenteBFCL V4
Instantánea de la fuenteBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
Fecha de los datos de la fuente
Recuperado por OpenGPT
Último cambio de la clasificaciónAún no hay un historial comparable
Última comprobación
TareasNo publicado
Nivel de evidenciaMantenido por el editor
Nota sobre la evidencia

Incluye las 109 filas del editor procedentes de un único CSV V4 fijado. Todas comparten el commit f7cf735, bfcl-eval 2025.12.17 y la misma composición de la precisión general.

Abrir auditoría

Qué no demuestra este resultado

Este resultado de BFCL describe un modelo y una configuración de llamadas a funciones, no un producto Agent completo ni un resultado sobre su idoneidad para producción.

Comparar elementos equivalentes

Solo pueden incluirse en una misma comparación configuraciones de la misma versión de la prueba de referencia y con el mismo alcance de tareas.

Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.

Validar antes de adoptar

Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.

  1. 1

    Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.

  2. 2

    Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.

  3. 3

    Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.

  4. 4

    Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.

Directorio y evaluaciones de Agents