Agent配置 · Berkeley Function-Calling Leaderboard

BFCL V4 · o3-2025-04-16 (Prompt)

榜单评估的完整对象,包括模型、框架、工具、权限、预算与运行环境。

综合准确率63.05%
每次成功成本未公布
来源公布的结果范围未公布

01

配置

Agent系统BFCL V4 · o3-2025-04-16 (Prompt)
基础模型o3-2025-04-16 (Prompt)
来源模型ID或名称o3-2025-04-16 (Prompt)
Agent框架BFCL V4 tool-use evaluation
Agent框架版本bfcl-eval 2025.12.17
工具Prompt-based function calling
运行环境函数调用、网页搜索、记忆、多轮交互、幻觉与格式敏感性测试
预算按类别采用发布方评测协议

02

结果

综合准确率63.05%
部分完成分未公布
每次成功成本未公布
来源公布的评测总成本US$234.64
完成时间中位数未公布
人工介入率未公布

03

运行情况

重复运行证据未公布
来源公布的结果范围未公布
安全提示未公布
可比组bfcl-v4-f7cf735-2025-12-17-overall
评测日期
数据获取日期

04

可信度

证据状态已列入基准官方榜单
数据来源BFCL V4
数据快照BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17 · 2026年4月12日
最近核查2026年8月1日
任务数未公布
证据等级发布方维护
证据说明

收录同一份冻结V4 CSV中发布方全部109个配置;所有记录采用commit f7cf735、bfcl-eval 2025.12.17和相同综合准确率口径。

审计说明

这项结果不能说明什么

结果只适用于这里显示的完整系统和来源条件。它不能证明存在万能Agent,也不能证明生产可靠性、数据治理或其他评测版本的表现。

只比较相同范围

只有评测版本和任务范围一致的配置,才能加入同一组对比。

数据来自公开来源,缺失项保持未知。

采用前做一次真实验证

公开榜单用于缩小候选范围,是否适合你的工作,需要通过小规模私有测试确认。

  1. 1

    选择 10–20 个代表性任务,并写清通过条件。

  2. 2

    测试前锁定Agent、模型、工具、权限和预算。

  3. 3

    重要任务重复运行,记录成功率、成本、时间和人工接管。

  4. 4

    检查失败案例和数据风险后,再决定是否正式采用。

全部AI Agent榜单