Fontes verificadas:
Diretório e avaliações de Agentes de IA
Encontre produtos de Agentes verificados e compare configurações publicadas somente dentro do mesmo escopo de benchmark.
- Posição 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
- Posição 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
- Posição 3TRAE + Doubao-Seed-CodeByteDance78.8%
Diretório de produtos Agent
Sobre as listagens do diretório
Sistemas de Agentes distintos com página oficial do produto, página de documentação ou repositório verificado. A inclusão no diretório verifica a identidade e um ponto de entrada oficial, não o desempenho nem uma recomendação. Somente evidências públicas do mesmo escopo aparecem no ranking abaixo.
Produtos verificados
66Fontes verificadas:
Fonte oficial
Fontes verificadas:
Fonte oficial
Fontes verificadas:
Fonte oficial
Fontes verificadas:
Fonte oficial
Fontes verificadas:
Fonte oficial
Fontes verificadas:
Fonte oficial
Fontes verificadas:
Fonte oficial
Programação
- Posição 1
- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- Não publicado
Resolvido79.2%Listado pelo publicador do benchmarkFonte - Posição 1
- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- Não publicado
Resolvido79.2%Listado pelo publicador do benchmarkFonte - Posição 3
TRAE + Doubao-Seed-Code
ByteDance- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- Não publicado
Resolvido78.8%Listado pelo publicador do benchmarkFonte - Posição 4
- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- Não publicado
Resolvido77.4%Listado pelo publicador do benchmarkFonte - Posição 5
Atlassian Rovo Dev (2025-09-02)
Atlassian- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- Não publicado
Resolvido76.8%Listado pelo publicador do benchmarkFonte - Posição 5
- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- Não publicado
Resolvido76.8%Listado pelo publicador do benchmarkFonte - Posição 5
- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- US$ 376,95
Resolvido76.8%Listado pelo publicador do benchmarkFonte - Posição 8
ACoder
ACoder- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- Não publicado
Resolvido76.4%Listado pelo publicador do benchmarkFonte - Posição 9
- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- US$ 177,98
Resolvido75.8%Listado pelo publicador do benchmarkFonte - Posição 9
- Evidências de execuções repetidas
- Não publicado
- Custo informado do benchmark
- US$ 36,64
Resolvido75.8%Listado pelo publicador do benchmarkFonte
Visão geral dos resultados
- Posição 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
- Posição 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
- Posição 3TRAE + Doubao-Seed-Code78.8%
- Posição 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
- Posição 5Atlassian Rovo Dev (2025-09-02)76.8%
Observação sobre as evidências
Mantenha esses resultados como evidências históricas. Uma auditoria da OpenAI de 2026 relatou problemas de concepção e contaminação no SWE-bench Verified.
Abrir auditoriaDados informados pela fonte; os valores ausentes permanecem desconhecidos.Validar antes da adoção
As classificações públicas geram uma pré-seleção. Um pequeno teste privado determina se a configuração é adequada ao seu trabalho.
- 1
Escolha de 10 a 20 tarefas representativas e defina uma condição de aprovação clara.
- 2
Fixe o Agente, o modelo, as ferramentas, as permissões e o orçamento antes de testar.
- 3
Execute cada tarefa importante mais de uma vez; registre sucesso, custo, tempo e intervenções.
- 4
Revise as falhas e os riscos do tratamento de dados antes de tomar uma decisão de produção.