Benchmarks de Agents

Benchmark de agentes de τ²-bench Core

O OpenGPT mantém 8 linhas publicadas vinculadas à versão exata τ²-bench Core do benchmark e ao ambiente exibido abaixo.

Tarefas
278
Linhas publicadas
8
Data dos dados da fonte
Identidade revisada
Atual

Escopo das evidências

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials. base tasks across retail, airline, and telecom. Standard agent, standard domain tools, and a shared GPT-5.2 low-reasoning user simulator. 4 trials per task · 1,112 trajectories per configuration.

How OpenGPT handles this evidence

O OpenGPT preserva a métrica, o escopo de tarefas, o ambiente, a versão, os campos de configuração e a data da fonte fornecidos pelo publicador. Ele não cria uma pontuação geral de Agentes que combine benchmarks.

Limites da comparação

  • Um resultado mais alto se aplica apenas à versão e às condições do benchmark exibidas.
  • Os resultados de Agents refletem o sistema completo, não apenas o modelo base.
  • Dados ausentes de custo, confiabilidade, segurança ou latência continuam sem ser informados, em vez de serem inferidos.
  • O OpenGPT inclui somente as oito linhas enviadas pelo publicador que compartilham o benchmark v1.0.1, a estrutura e as ferramentas padrão, o mesmo simulador de usuário, as mesmas divisões de tarefas base e quatro tentativas. Outras linhas do τ-bench permanecem fora deste escopo.

v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials

Mostrando 8 de 8 linhas publicadas. Cada resultado permanece vinculado ao benchmark e à configuração da fonte.

  1. τ² standard agent · Qwen3.5-397B-A17B · thinkingAlibaba Cloud · Qwen3.5-397B-A17B#1Average Pass¹: 87.91%τ² standard agent
  2. τ² standard agent · Claude Opus 4.5 · altoAnthropic · Claude Opus 4.5#2Average Pass¹: 85.31%τ² standard agent
  3. τ² standard agent · GPT-5.2 · altoOpenAI · GPT-5.2#3Average Pass¹: 84.76%τ² standard agent
  4. τ² standard agent · Gemini 3 Flash Preview · altoGoogle · Gemini 3 Flash Preview#4Average Pass¹: 83.49%τ² standard agent
  5. τ² standard agent · Gemini 3 Pro Preview · altoGoogle · Gemini 3 Pro Preview#5Average Pass¹: 82.46%τ² standard agent
  6. τ² standard agent · GLM-5 · thinkingZhipu AI · GLM-5#6Average Pass¹: 81.01%τ² standard agent
  7. τ² standard agent · Claude Sonnet 4.5 · raciocínio estendidoAnthropic · Claude Sonnet 4.5#7Average Pass¹: 76.41%τ² standard agent
  8. τ² standard agent · GPT-5.2 · sem raciocínioOpenAI · GPT-5.2#8Average Pass¹: 61.58%τ² standard agent