Configuração de Agent · Terminal-Bench 2.1
mini-SWE-agent · Muse Spark 1.1 · xhigh
O objeto classificado: modelo, estrutura, ferramentas, permissões, orçamento e ambiente em conjunto.
01
Configuração
02
Resultado
03
Operação
04
Confiança
Observação sobre as evidências
A equipe do Terminal-Bench afirma ter executado e verificado estes envios. A versão 2.1 revisou as tarefas e o ambiente de avaliação.
Abrir auditoria ↗O que este resultado não comprova
Este resultado se aplica às condições exatas do sistema e da fonte exibidas aqui. Ele não estabelece qual é o melhor agente universal, nem comprova confiabilidade em produção, governança de dados ou desempenho em outra versão do benchmark.
Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
Validar antes da adoção
As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.
- 1
Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.
- 2
Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.
- 3
Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.
- 4
Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.