Sources vérifiées:
Annuaire et évaluations des agents d’IA
Trouvez des produits Agent vérifiés, puis comparez les configurations publiées uniquement au sein du même périmètre de benchmark.
- Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
- Rang 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
- Rang 3TRAE + Doubao-Seed-CodeByteDance78.8%
Annuaire des produits Agent
À propos des entrées de l’annuaire
Systèmes Agent distincts disposant d’une page produit, d’une page de documentation ou d’un dépôt propriétaire vérifié. L’inclusion dans l’annuaire vérifie l’identité et un point d’entrée officiel, pas les performances ni une recommandation. Seules les preuves publiques de même périmètre apparaissent dans le classement ci-dessous.
Produits vérifiés
66Sources vérifiées:
Source officielle
Sources vérifiées:
Source officielle
Sources vérifiées:
Source officielle
Sources vérifiées:
Source officielle
Sources vérifiées:
Source officielle
Sources vérifiées:
Source officielle
Sources vérifiées:
Source officielle
Développement
- Rang 1
- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- Non publié
Résolu79.2%Répertorié par l’éditeur du benchmarkSource - Rang 1
- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- Non publié
Résolu79.2%Répertorié par l’éditeur du benchmarkSource - Rang 3
TRAE + Doubao-Seed-Code
ByteDance- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- Non publié
Résolu78.8%Répertorié par l’éditeur du benchmarkSource - Rang 4
- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- Non publié
Résolu77.4%Répertorié par l’éditeur du benchmarkSource - Rang 5
Atlassian Rovo Dev (2025-09-02)
Atlassian- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- Non publié
Résolu76.8%Répertorié par l’éditeur du benchmarkSource - Rang 5
- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- Non publié
Résolu76.8%Répertorié par l’éditeur du benchmarkSource - Rang 5
- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- 376,95 $US
Résolu76.8%Répertorié par l’éditeur du benchmarkSource - Rang 8
ACoder
ACoder- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- Non publié
Résolu76.4%Répertorié par l’éditeur du benchmarkSource - Rang 9
- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- 177,98 $US
Résolu75.8%Répertorié par l’éditeur du benchmarkSource - Rang 9
- Preuves issues d’exécutions répétées
- Non publié
- Coût de benchmark déclaré
- 36,64 $US
Résolu75.8%Répertorié par l’éditeur du benchmarkSource
Aperçu des résultats
- Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
- Rang 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
- Rang 3TRAE + Doubao-Seed-Code78.8%
- Rang 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
- Rang 5Atlassian Rovo Dev (2025-09-02)76.8%
Note sur les preuves
Conservez ces résultats comme des preuves historiques. Un audit OpenAI de 2026 a signalé des problèmes de conception et de contamination dans SWE-bench Verified.
Ouvrir l’auditDonnées déclarées par la source ; les valeurs manquantes restent inconnues.Valider avant l’adoption
Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.
- 1
Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.
- 2
Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.
- 3
Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.
- 4
Examinez les échecs et les risques liés au traitement des données avant toute décision de production.