Sinal de modelos com chamada de ferramentas · Berkeley Function-Calling Leaderboard

BFCL V4 · Claude-Opus-4-5-20251101 (FC)

Este resultado do BFCL descreve um modelo e uma configuração de chamada de funções, não um produto de Agente completo nem a prontidão para produção.

Precisão geral77.47%
Custo por tarefa concluída com sucessoNão publicado
Faixa de resultados publicadaNão publicado

01

Configuração

Sistema AgentBFCL V4 · Claude-Opus-4-5-20251101 (FC)
Modelo baseClaude-Opus-4-5-20251101 (FC)
ID ou rótulo do modelo na fonteClaude-Opus-4-5-20251101 (FC)
EstruturaBFCL V4 tool-use evaluation
Versão da estruturabfcl-eval 2025.12.17
FerramentasNative function calling
AmbienteChamadas de função, pesquisa na web, memória, múltiplos turnos, alucinação e testes de sensibilidade ao formato
OrçamentoProtocolo do publicador específico da categoria

02

Resultado

Precisão geral77.47%
Pontuação parcialNão publicado
Custo por tarefa concluída com sucessoNão publicado
Custo informado do benchmarkUS$ 86,55
Tempo mediano de conclusãoNão publicado
Intervenção humanaNão publicado

03

Operação

Evidências de execuções repetidasNão publicado
Faixa de resultados publicadaNão publicado
Observação de segurançaNão publicado
Grupo de comparabilidadebfcl-v4-f7cf735-2025-12-17-overall
Data da avaliação
Dados registrados

04

Confiança

EvidênciaListado pelo publicador do benchmark
FonteBFCL V4
Instantâneo da fonteBFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
Data dos dados da fonte
Recuperado pelo OpenGPT
Última mudança na classificaçãoAinda não há histórico comparável
Última verificação
TarefasNão publicado
Nível de evidênciaMantido pelo publicador
Observação sobre as evidências

Inclui todas as 109 linhas do publicador provenientes de um único CSV V4 congelado. Todas compartilham o commit f7cf735, o bfcl-eval 2025.12.17 e a mesma composição da precisão geral.

Abrir auditoria

O que este resultado não comprova

Este resultado do BFCL descreve um modelo e uma configuração de chamada de funções, não um produto de Agente completo nem a prontidão para produção.

Compare opções equivalentes

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents