Configuração de Agent · τ²-bench Core

τ² standard agent · Claude Sonnet 4.5 · extended thinking

O objeto classificado: modelo, estrutura, ferramentas, permissões, orçamento e ambiente em conjunto.

Média de aprovação¹76.41%
Custo por tarefa concluída com sucessoNão publicado
Faixa de resultados publicadaNão publicado

01

Configuração

Sistema Agentτ² standard agent · Claude Sonnet 4.5 · extended thinking
Modelo baseClaude Sonnet 4.5
ID ou rótulo do modelo na fonteClaude Sonnet 4.5 · extended thinking
Estruturaτ² standard agent
Versão da estruturav1.0.1
FerramentasStandard retail, airline, and telecom domain tools
AmbienteAgente padrão e ferramentas do domínio com um simulador de usuário compartilhado GPT-5.2 de baixo raciocínio
Orçamento4 testes por tarefa · 1.112 trajetórias por configuração

02

Resultado

Média de aprovação¹76.41%
Pontuação parcialNão publicado
Custo por tarefa concluída com sucessoNão publicado
Custo informado do benchmarkNão informado
Tempo mediano de conclusãoNão publicado
Intervenção humanaNão publicado

03

Operação

Evidências de execuções repetidas4 execuções
Faixa de resultados publicadaNão publicado
Observação de segurançaNão publicado
Grupo de comparabilidadetau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
Data da avaliação
Dados registrados

04

Confiança

EvidênciaListado pelo publicador do benchmark
FonteSierra Research · τ²-bench
Instantâneo da fontev1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
Data dos dados da fonte
Recuperado pelo OpenGPT
Última mudança na classificaçãoAinda não há histórico comparável
Última verificação
Tarefas278 tarefas base de varejo, companhias aéreas e telecomunicações
Nível de evidênciaMantido pelo publicador
Observação sobre as evidências

São incluídas apenas oito linhas enviadas pelo publicador que compartilham o benchmark v1.0.1, a estrutura e as ferramentas padrão, o simulador de usuário, as divisões de tarefas base e o protocolo de quatro tentativas. Outras linhas do τ-bench permanecem fora deste escopo.

Abrir auditoria

O que este resultado não comprova

Este resultado se aplica às condições exatas do sistema e da fonte exibidas aqui. Ele não estabelece qual é o melhor agente universal, nem comprova confiabilidade em produção, governança de dados ou desempenho em outra versão do benchmark.

Compare opções equivalentes

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents