Directorio y evaluaciones de Agents de AI

Encuentra productos de agentes verificados y compara las configuraciones publicadas únicamente dentro del mismo ámbito de benchmark.

Los 3 mejores de la evaluaciónSWE-bench Verified · Resuelto · 10 configuraciones comparables
  1. Posición 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. Posición 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. Posición 3TRAE + Doubao-Seed-CodeByteDance78.8%

Programación

Elige una categoría de tareas
Instantánea y cambiosAún no se ha guardado ninguna instantánea comparable anterior.Instantánea actual de la fuente
  1. Posición 1
    Modelo base
    Claude 4.5 Opus medium (20251101)
    Andamiaje
    live-SWE-agent
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    No publicado
    Resuelto
    79.2%
  2. Posición 1
    Modelo base
    Claude 4.5 Opus
    Andamiaje
    Sonar Foundation Agent
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    No publicado
    Resuelto
    79.2%
  3. Posición 3
    Modelo base
    Doubao-Seed-Code + Doubao-Seed-1.6
    Andamiaje
    TRAE
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    No publicado
    Resuelto
    78.8%
  4. Posición 4
    Modelo base
    Gemini 3 Pro Preview (2025-11-18)
    Andamiaje
    live-SWE-agent
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    No publicado
    Resuelto
    77.4%
  5. Posición 5
    Modelo base
    Claude Sonnet 4 + GPT-5
    Andamiaje
    Atlassian Rovo Dev
    Versión del andamiaje
    2025-09-02
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    No publicado
    Resuelto
    76.8%
  6. Posición 5
    Modelo base
    Claude 4 Sonnet
    Andamiaje
    EPAM AI/Run Developer Agent
    Versión del andamiaje
    v20250719
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    No publicado
    Resuelto
    76.8%
  7. Posición 5
    Modelo base
    Claude 4.5 Opus (high reasoning)
    Andamiaje
    mini-SWE-agent
    Versión del andamiaje
    2.0.0
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    376,95 US$
    Resuelto
    76.8%
  8. Posición 8

    ACoder

    ACoder
    Modelo base
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Andamiaje
    ACoder
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    No publicado
    Resuelto
    76.4%
  9. Posición 9
    Modelo base
    Gemini 3 Flash (high reasoning)
    Andamiaje
    mini-SWE-agent
    Versión del andamiaje
    2.0.0
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    177,98 US$
    Resuelto
    75.8%
  10. Posición 9
    Modelo base
    MiniMax M2.5 (high reasoning)
    Andamiaje
    mini-SWE-agent
    Versión del andamiaje
    2.0.0
    Pruebas de ejecuciones repetidas
    No publicado
    Coste comunicado de la prueba de referencia
    36,64 US$
    Resuelto
    75.8%
Resultados de un vistazo
Resultados de un vistazoSWE-bench Verified · Éxito de la tarea
  1. Posición 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. Posición 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. Posición 3TRAE + Doubao-Seed-Code78.8%
  4. Posición 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. Posición 5Atlassian Rovo Dev (2025-09-02)76.8%
Resultados publicadosSWE-bench VerifiedVerificado · Clasificación completa · 500 tareasEvidencia histórica
Fecha de los datos de la fuenteRecuperado por OpenGPTÚltimo cambio de la clasificaciónAún no hay un historial comparableOpenGPT comprueba la fuente de este agente al menos una vez por semana.
Resultado de la fuenteResuelto
Tareas500 · incidencias de GitHub validadas por personas
Nivel de evidenciaAdvertencia externa
Abrir fuente
Nota sobre la evidencia

Conserva estos resultados como evidencia histórica. Una auditoría de OpenAI de 2026 señaló problemas de diseño y contaminación en SWE-bench Verified.

Abrir auditoría
Datos comunicados por la fuente; los valores ausentes siguen siendo desconocidos.Validar antes de adoptar

Las clasificaciones públicas permiten elaborar una lista de finalistas. Una pequeña prueba privada determina si la configuración se adapta a tu trabajo.

  1. 1

    Elige entre 10 y 20 tareas representativas y define una condición de aprobación clara.

  2. 2

    Fija el agente, el modelo, las herramientas, los permisos y el presupuesto antes de realizar la prueba.

  3. 3

    Ejecute cada tarea importante más de una vez; registre el éxito, el coste, el tiempo y las intervenciones humanas.

  4. 4

    Revise los fallos y los riesgos del tratamiento de datos antes de tomar una decisión de producción.