Annuaire et évaluations des agents d’IA

Trouvez des produits Agent vérifiés, puis comparez les configurations publiées uniquement au sein du même périmètre de benchmark.

Top 3 de l’évaluationSWE-bench Verified · Résolu · 10 configurations comparables
  1. Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. Rang 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. Rang 3TRAE + Doubao-Seed-CodeByteDance78.8%

Développement

Choisir une catégorie de tâches
Instantané et changementsAucun instantané antérieur comparable n’est encore stocké.Instantané actuel de la source
  1. Rang 1
    Modèle de base
    Claude 4.5 Opus medium (20251101)
    Échafaudage
    live-SWE-agent
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    Non publié
    Résolu
    79.2%
  2. Rang 1
    Modèle de base
    Claude 4.5 Opus
    Échafaudage
    Sonar Foundation Agent
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    Non publié
    Résolu
    79.2%
  3. Rang 3
    Modèle de base
    Doubao-Seed-Code + Doubao-Seed-1.6
    Échafaudage
    TRAE
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    Non publié
    Résolu
    78.8%
  4. Rang 4
    Modèle de base
    Gemini 3 Pro Preview (2025-11-18)
    Échafaudage
    live-SWE-agent
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    Non publié
    Résolu
    77.4%
  5. Rang 5
    Modèle de base
    Claude Sonnet 4 + GPT-5
    Échafaudage
    Atlassian Rovo Dev
    Version de l’échafaudage
    2025-09-02
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    Non publié
    Résolu
    76.8%
  6. Rang 5
    Modèle de base
    Claude 4 Sonnet
    Échafaudage
    EPAM AI/Run Developer Agent
    Version de l’échafaudage
    v20250719
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    Non publié
    Résolu
    76.8%
  7. Rang 5
    Modèle de base
    Claude 4.5 Opus (high reasoning)
    Échafaudage
    mini-SWE-agent
    Version de l’échafaudage
    2.0.0
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    376,95 $US
    Résolu
    76.8%
  8. Rang 8

    ACoder

    ACoder
    Modèle de base
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Échafaudage
    ACoder
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    Non publié
    Résolu
    76.4%
  9. Rang 9
    Modèle de base
    Gemini 3 Flash (high reasoning)
    Échafaudage
    mini-SWE-agent
    Version de l’échafaudage
    2.0.0
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    177,98 $US
    Résolu
    75.8%
  10. Rang 9
    Modèle de base
    MiniMax M2.5 (high reasoning)
    Échafaudage
    mini-SWE-agent
    Version de l’échafaudage
    2.0.0
    Preuves issues d’exécutions répétées
    Non publié
    Coût de benchmark déclaré
    36,64 $US
    Résolu
    75.8%
Aperçu des résultats
Aperçu des résultatsSWE-bench Verified · Réussite de la tâche
  1. Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. Rang 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. Rang 3TRAE + Doubao-Seed-Code78.8%
  4. Rang 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. Rang 5Atlassian Rovo Dev (2025-09-02)76.8%
Résultats publiésSWE-bench VerifiedVérifié · Classement complet · 500 tâchesPreuve historique
Date des données sourcesRécupéré par OpenGPTDernière modification du classementAucun historique comparable pour l’instantOpenGPT vérifie cette source Agent au moins une fois par semaine.
Résultat sourceRésolu
Tâches500 · problèmes GitHub validés par des humains
Niveau de preuveAvertissement externe
Ouvrir la source
Note sur les preuves

Conservez ces résultats comme des preuves historiques. Un audit OpenAI de 2026 a signalé des problèmes de conception et de contamination dans SWE-bench Verified.

Ouvrir l’audit
Données déclarées par la source ; les valeurs manquantes restent inconnues.Valider avant l’adoption

Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.

  1. 1

    Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.

  2. 2

    Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.

  3. 3

    Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.

  4. 4

    Examinez les échecs et les risques liés au traitement des données avant toute décision de production.