Configuração de Agent · τ²-bench Core
τ² standard agent · GPT-5.2 · no reasoning
O objeto classificado: modelo, estrutura, ferramentas, permissões, orçamento e ambiente em conjunto.
01
Configuração
02
Resultado
03
Operação
04
Confiança
Observação sobre as evidências
São incluídas apenas oito linhas enviadas pelo publicador que compartilham o benchmark v1.0.1, a estrutura e as ferramentas padrão, o simulador de usuário, as divisões de tarefas base e o protocolo de quatro tentativas. Outras linhas do τ-bench permanecem fora deste escopo.
Abrir auditoria ↗O que este resultado não comprova
Este resultado se aplica às condições exatas do sistema e da fonte exibidas aqui. Ele não estabelece qual é o melhor agente universal, nem comprova confiabilidade em produção, governança de dados ou desempenho em outra versão do benchmark.
Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
Validar antes da adoção
As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.
- 1
Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.
- 2
Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.
- 3
Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.
- 4
Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.