도구 호출 모델 신호 · Berkeley Function-Calling Leaderboard

BFCL V4 · Llama-3.2-3B-Instruct (FC)

이 BFCL 결과는 모델과 함수 호출 설정을 설명하며 전체 Agent 제품이나 프로덕션 준비 상태를 의미하지 않습니다.

전체 정확도21.95%
성공 작업당 비용공개되지 않음
공개된 결과 범위공개되지 않음

01

구성

에이전트 시스템BFCL V4 · Llama-3.2-3B-Instruct (FC)
기반 모델Llama-3.2-3B-Instruct (FC)
출처 모델 ID 또는 표기Llama-3.2-3B-Instruct (FC)
스캐폴드BFCL V4 tool-use evaluation
스캐폴드 버전bfcl-eval 2025.12.17
도구Native function calling
환경함수 호출, 웹 검색, 메모리, 멀티턴, 환각 및 형식 민감도 테스트
예산범주별 게시자 프로토콜

02

결과

전체 정확도21.95%
부분 점수공개되지 않음
성공 작업당 비용공개되지 않음
공개된 전체 비용US$6.2
완료 시간 중앙값공개되지 않음
사람 개입공개되지 않음

03

운영

반복 실행 근거공개되지 않음
공개된 결과 범위공개되지 않음
안전 참고공개되지 않음
비교 그룹bfcl-v4-f7cf735-2025-12-17-overall
평가 날짜
데이터 수집일

04

신뢰

근거벤치마크 공식 목록에 등재
출처BFCL V4
출처 스냅샷BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
출처 데이터 날짜
OpenGPT 수집 시각
순위 최종 변경일비교 이력 없음
마지막 확인
과제공개되지 않음
근거 수준게시자 관리
근거 참고

고정된 V4 CSV의 게시자 전체 109개 행을 포함합니다. 모든 행은 commit f7cf735, bfcl-eval 2025.12.17 및 동일한 전체 정확도 구성을 공유합니다.

감사 정보

이 결과가 증명하지 않는 것

이 BFCL 결과는 모델과 함수 호출 설정을 설명하며 전체 Agent 제품이나 프로덕션 준비 상태를 의미하지 않습니다.

같은 조건끼리 비교

같은 벤치마크 버전과 작업 범위의 구성만 비교할 수 있습니다.

출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.

도입 전 검증

공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

  1. 1

    대표 작업 10~20개와 명확한 통과 조건을 정합니다.

  2. 2

    Agent, 모델, 도구, 권한과 예산을 고정합니다.

  3. 3

    중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

  4. 4

    실패와 데이터 처리 위험을 검토한 뒤 도입합니다.

AI 에이전트 순위