Configuração de Agent · SWE-bench Verified
live-SWE-agent + Claude 4.5 Opus medium (20251101)
O objeto classificado: modelo, estrutura, ferramentas, permissões, orçamento e ambiente em conjunto.
01
Configuração
02
Resultado
03
Operação
04
Confiança
Observação sobre as evidências
Mantenha esses resultados como evidências históricas. Uma auditoria da OpenAI de 2026 relatou problemas de concepção e contaminação no SWE-bench Verified.
Abrir auditoria ↗O que este resultado não comprova
Este resultado se aplica às condições exatas do sistema e da fonte exibidas aqui. Ele não estabelece qual é o melhor agente universal, nem comprova confiabilidade em produção, governança de dados ou desempenho em outra versão do benchmark.
Dados informados pela fonte; os valores ausentes permanecem desconhecidos.
Validar antes da adoção
As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.
- 1
Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.
- 2
Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.
- 3
Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.
- 4
Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.