Configuração de Agent · Terminal-Bench 2.1

mini-SWE-agent · Muse Spark 1.1 · xhigh

O objeto classificado: modelo, estrutura, ferramentas, permissões, orçamento e ambiente em conjunto.

Precisão da tarefa76.2%
Custo por tarefa concluída com sucessoNão publicado
Faixa de resultados publicada±2.4%

01

Configuração

Sistema Agentmini-SWE-agent · Muse Spark 1.1 · xhigh
Modelo baseMuse Spark 1.1
ID ou rótulo do modelo na fonteMuse Spark 1.1
Estruturamini-SWE-agent
Versão da estruturaNão informado
FerramentasTerminal shell
AmbienteAmbientes de terminal gerenciados pelo Harbor
OrçamentoLimites fixos · pelo menos 5 tentativas por tarefa

02

Resultado

Precisão da tarefa76.2%
Pontuação parcialNão publicado
Custo por tarefa concluída com sucessoNão publicado
Custo informado do benchmarkUS$ 198,05
Tempo mediano de conclusãoNão publicado
Intervenção humanaNão publicado

03

Operação

Evidências de execuções repetidasNão publicado
Faixa de resultados publicada±2.4%
Observação de segurançaNão publicado
Grupo de comparabilidadeterminal-bench-2-1-main
Data da avaliação
Dados registrados

04

Confiança

EvidênciaListado pelo publicador do benchmark
FonteTerminal-Bench 2.1
Instantâneo da fonteTerminal-Bench 2.1 · leaderboard verificado pelo publicador
Data dos dados da fonte
Recuperado pelo OpenGPT
Última mudança na classificação
Última verificação
Tarefas89 tarefas de terminal
Nível de evidênciaMantido pelo publicador
Observação sobre as evidências

A equipe do Terminal-Bench afirma ter executado e verificado estes envios. A versão 2.1 revisou as tarefas e o ambiente de avaliação.

Abrir auditoria

O que este resultado não comprova

Este resultado se aplica às condições exatas do sistema e da fonte exibidas aqui. Ele não estabelece qual é o melhor agente universal, nem comprova confiabilidade em produção, governança de dados ou desempenho em outra versão do benchmark.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents