Escopo compartilhado do benchmark · τ²-bench Core

Comparação de agentes no mesmo benchmark

As entradas abaixo compartilham o mesmo escopo de benchmark. As estruturas, versões de modelos, datas e valores originais exatos das fontes permanecem visíveis.

Um valor de origem mais alto significa apenas um desempenho melhor neste benchmark e nesta configuração. Não é uma pontuação comparável entre benchmarks nem de prontidão para produção.

Compare opções equivalentes

Visão geral da decisão

Somente configurações da mesma versão de benchmark e do mesmo escopo de tarefas podem ser incluídas em uma comparação.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
Zhipu AIτ² standard agent · GLM-5 · thinking
Média de aprovação¹81.01%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
Alibaba Cloudτ² standard agent · Qwen3.5-397B-A17B · thinking
Média de aprovação¹87.91%Custo por tarefa concluída com sucessoNão publicadoFaixa de resultados publicadaNão publicado
Detalhes do Agent
18 campos idênticos ou totalmente sem dados ocultos
Sistema Agentτ² standard agent · GLM-5 · thinkingτ² standard agent · Qwen3.5-397B-A17B · thinking
Configuração
Modelo baseGLM-5Qwen3.5-397B-A17B
ID ou rótulo do modelo na fonteGLM-5 · thinkingQwen3.5-397B-A17B · thinking
Resultado
Média de aprovação¹81.01%87.91%
Fonte
Abrir fonteAbrir fonteAbrir fonte

Configuração

τ² standard agent · GLM-5 · thinking

Modelo base
GLM-5
ID ou rótulo do modelo na fonte
GLM-5 · thinking

τ² standard agent · Qwen3.5-397B-A17B · thinking

Modelo base
Qwen3.5-397B-A17B
ID ou rótulo do modelo na fonte
Qwen3.5-397B-A17B · thinking

Resultado

τ² standard agent · GLM-5 · thinking

Média de aprovação¹
81.01%

τ² standard agent · Qwen3.5-397B-A17B · thinking

Média de aprovação¹
87.91%

Fonte

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents