Configuração de Agent · SWE-bench Verified

EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet

O objeto classificado: modelo, estrutura, ferramentas, permissões, orçamento e ambiente em conjunto.

Abrir fonte
Resolvido76.8%
Custo por tarefa concluída com sucessoNão publicado
Faixa de resultados publicadaNão publicado

01

Configuração

Sistema AgentEPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet
Modelo baseClaude 4 Sonnet
ID ou rótulo do modelo na fonteclaude-sonnet-4-20250514
EstruturaEPAM AI/Run Developer Agent
Versão da estruturav20250719
FerramentasNão informado
AmbienteAmbientes de repositório reproduzíveis avaliados pelo SWE-bench
OrçamentoOs limites variam conforme a configuração enviada

02

Resultado

Resolvido76.8%
Pontuação parcialNão publicado
Custo por tarefa concluída com sucessoNão publicado
Custo informado do benchmarkNão informado
Tempo mediano de conclusãoNão publicado
Intervenção humanaNão publicado

03

Operação

Evidências de execuções repetidasNão publicado
Faixa de resultados publicadaNão publicado
Observação de segurançaNão publicado
Grupo de comparabilidadeswe-bench-verified-full-500
Data da avaliação
Dados registrados

04

Confiança

EvidênciaListado pelo publicador do benchmark
FonteSWE-bench Verified
Instantâneo da fonteVerificado · Leaderboard completo · 500 tarefas
Data dos dados da fonte
Recuperado pelo OpenGPT
Última mudança na classificaçãoAinda não há histórico comparável
Última verificação
Tarefas500 issues do GitHub validadas por humanos
Nível de evidênciaAlerta externo
Observação sobre as evidências

Mantenha esses resultados como evidências históricas. Uma auditoria da OpenAI de 2026 relatou problemas de concepção e contaminação no SWE-bench Verified.

Abrir auditoria

O que este resultado não comprova

Este resultado se aplica às condições exatas do sistema e da fonte exibidas aqui. Ele não estabelece qual é o melhor agente universal, nem comprova confiabilidade em produção, governança de dados ou desempenho em outra versão do benchmark.

Dados informados pela fonte; os valores ausentes permanecem desconhecidos.

Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.

Diretório e avaliações de Agents