에이전트 구성 · Berkeley Function-Calling Leaderboard
BFCL V4 · Qwen3-235B-A22B-Instruct-2507 (Prompt)
모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.
전체 정확도52.15%
성공 작업당 비용공개되지 않음
공개된 결과 범위공개되지 않음
01
구성
에이전트 시스템BFCL V4 · Qwen3-235B-A22B-Instruct-2507 (Prompt)
기반 모델Qwen3-235B-A22B-Instruct-2507 (Prompt)
출처 모델 ID 또는 표기Qwen3-235B-A22B-Instruct-2507 (Prompt)
스캐폴드BFCL V4 tool-use evaluation
스캐폴드 버전bfcl-eval 2025.12.17
도구Prompt-based function calling
환경함수 호출, 웹 검색, 메모리, 멀티턴, 환각 및 형식 민감도 테스트
예산범주별 게시자 프로토콜
02
결과
전체 정확도52.15%
부분 점수공개되지 않음
성공 작업당 비용공개되지 않음
공개된 전체 비용US$3.12
완료 시간 중앙값공개되지 않음
사람 개입공개되지 않음
03
운영
반복 실행 근거공개되지 않음
공개된 결과 범위공개되지 않음
안전 참고공개되지 않음
비교 그룹bfcl-v4-f7cf735-2025-12-17-overall
평가 날짜
데이터 수집일
04
신뢰
근거벤치마크 공식 목록에 등재
출처BFCL V4
출처 스냅샷BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17 · 2026년 4월 12일
마지막 확인2026년 8월 1일
과제공개되지 않음
근거 수준게시자 관리
근거 참고
고정된 V4 CSV의 게시자 전체 109개 행을 포함합니다. 모든 행은 commit f7cf735, bfcl-eval 2025.12.17 및 동일한 전체 정확도 구성을 공유합니다.
감사 정보 ↗이 결과가 증명하지 않는 것
표시된 시스템과 출처 조건에만 적용됩니다. 보편적 최고, 운영 신뢰성, 데이터 거버넌스 또는 다른 버전의 성능을 증명하지 않습니다.
출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.
도입 전 검증
공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.
- 1
대표 작업 10~20개와 명확한 통과 조건을 정합니다.
- 2
Agent, 모델, 도구, 권한과 예산을 고정합니다.
- 3
중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.
- 4
실패와 데이터 처리 위험을 검토한 뒤 도입합니다.