Configuration de l’Agent · SWE-bench Verified

Sonar Foundation Agent + Claude 4.5 Opus

L’objet classé : modèle, échafaudage, outils, autorisations, budget et environnement réunis.

Ouvrir la source
Résolu79.2%
Coût par tâche réussieNon publié
Plage des résultats publiésNon publié

01

Configuration

Système AgentSonar Foundation Agent + Claude 4.5 Opus
Modèle de baseClaude 4.5 Opus
ID ou libellé du modèle sourceclaude-opus-4-5
ÉchafaudageSonar Foundation Agent
Version de l’échafaudageNon renseigné
OutilsNon renseigné
EnvironnementEnvironnements de dépôt reproductibles évalués par SWE-bench
BudgetLes limites varient selon la configuration soumise

02

Résultat obtenu

Résolu79.2%
Score partielNon publié
Coût par tâche réussieNon publié
Coût de benchmark déclaréNon renseigné
Durée médiane d’achèvementNon publié
Intervention humaineNon publié

03

Opération

Preuves issues d’exécutions répétéesNon publié
Plage des résultats publiésNon publié
Note de sécuritéNon publié
Groupe de comparabilitéswe-bench-verified-full-500
Date de l’évaluation
Données saisies

04

Confiance

PreuvesRépertorié par l’éditeur du benchmark
SourceSWE-bench Verified
Instantané de la sourceVérifié · Classement complet · 500 tâches
Date des données sources
Récupéré par OpenGPT
Dernière modification du classementAucun historique comparable pour l’instant
Dernière vérification
Tâches500 problèmes GitHub validés par des humains
Niveau de preuveAvertissement externe
Note sur les preuves

Conservez ces résultats comme des preuves historiques. Un audit OpenAI de 2026 a signalé des problèmes de conception et de contamination dans SWE-bench Verified.

Ouvrir l’audit

Ce que ce résultat ne prouve pas

Ce résultat s’applique au système exact et aux conditions de source indiquées ici. Il n’établit ni le meilleur agent universel, ni la fiabilité en production, ni la gouvernance des données, ni les performances sur une autre version du benchmark.

Données déclarées par la source ; les valeurs manquantes restent inconnues.

Valider avant l’adoption

Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.

  1. 1

    Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.

  2. 2

    Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.

  3. 3

    Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.

  4. 4

    Examinez les échecs et les risques liés au traitement des données avant toute décision de production.

Annuaire et évaluations des Agents