Diretório e avaliações de Agentes de IA

Encontre produtos de Agentes verificados e compare configurações publicadas somente dentro do mesmo escopo de benchmark.

3 melhores da avaliaçãoSWE-bench Verified · Resolvido · 10 configurações comparáveis
  1. Posição 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. Posição 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. Posição 3TRAE + Doubao-Seed-CodeByteDance78.8%

Programação

Escolha uma categoria de tarefa
Instantâneo e mudançasAinda não há um instantâneo anterior comparável armazenado.Instantâneo atual da fonte
  1. Posição 1
    Modelo base
    Claude 4.5 Opus medium (20251101)
    Estrutura
    live-SWE-agent
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    Não publicado
    Resolvido
    79.2%
  2. Posição 1
    Modelo base
    Claude 4.5 Opus
    Estrutura
    Sonar Foundation Agent
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    Não publicado
    Resolvido
    79.2%
  3. Posição 3
    Modelo base
    Doubao-Seed-Code + Doubao-Seed-1.6
    Estrutura
    TRAE
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    Não publicado
    Resolvido
    78.8%
  4. Posição 4
    Modelo base
    Gemini 3 Pro Preview (2025-11-18)
    Estrutura
    live-SWE-agent
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    Não publicado
    Resolvido
    77.4%
  5. Posição 5
    Modelo base
    Claude Sonnet 4 + GPT-5
    Estrutura
    Atlassian Rovo Dev
    Versão da estrutura
    2025-09-02
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    Não publicado
    Resolvido
    76.8%
  6. Posição 5
    Modelo base
    Claude 4 Sonnet
    Estrutura
    EPAM AI/Run Developer Agent
    Versão da estrutura
    v20250719
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    Não publicado
    Resolvido
    76.8%
  7. Posição 5
    Modelo base
    Claude 4.5 Opus (high reasoning)
    Estrutura
    mini-SWE-agent
    Versão da estrutura
    2.0.0
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    US$ 376,95
    Resolvido
    76.8%
  8. Posição 8

    ACoder

    ACoder
    Modelo base
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Estrutura
    ACoder
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    Não publicado
    Resolvido
    76.4%
  9. Posição 9
    Modelo base
    Gemini 3 Flash (high reasoning)
    Estrutura
    mini-SWE-agent
    Versão da estrutura
    2.0.0
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    US$ 177,98
    Resolvido
    75.8%
  10. Posição 9
    Modelo base
    MiniMax M2.5 (high reasoning)
    Estrutura
    mini-SWE-agent
    Versão da estrutura
    2.0.0
    Evidências de execuções repetidas
    Não publicado
    Custo informado do benchmark
    US$ 36,64
    Resolvido
    75.8%
Visão geral dos resultados
Visão geral dos resultadosSWE-bench Verified · Sucesso da tarefa
  1. Posição 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. Posição 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. Posição 3TRAE + Doubao-Seed-Code78.8%
  4. Posição 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. Posição 5Atlassian Rovo Dev (2025-09-02)76.8%
Resultados publicadosSWE-bench VerifiedVerificado · Leaderboard completo · 500 tarefasEvidências históricas
Data dos dados da fonteRecuperado pelo OpenGPTÚltima mudança na classificaçãoAinda não há histórico comparávelO OpenGPT verifica esta fonte de Agente pelo menos uma vez por semana.
Resultado da fonteResolvido
Tarefas500 · issues do GitHub validadas por humanos
Nível de evidênciaAlerta externo
Abrir fonte
Observação sobre as evidências

Mantenha esses resultados como evidências históricas. Uma auditoria da OpenAI de 2026 relatou problemas de concepção e contaminação no SWE-bench Verified.

Abrir auditoria
Dados informados pela fonte; os valores ausentes permanecem desconhecidos.Validar antes da adoção

As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.

  1. 1

    Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.

  2. 2

    Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.

  3. 3

    Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.

  4. 4

    Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.