Périmètre de benchmark partagé · SWE-bench Verified

Comparaison d’agents au sein du même benchmark

Les entrées ci-dessous relèvent du même périmètre de benchmark. Leurs échafaudages, versions de modèles, dates et valeurs sources d’origine exacts restent visibles.

Une valeur source plus élevée indique uniquement de meilleures performances pour ce benchmark et cette configuration. Il ne s’agit ni d’un score comparable entre benchmarks ni d’un indicateur d’aptitude à la production.

Comparer ce qui est comparable

Vue d’ensemble de la décision

Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.

Données déclarées par la source ; les valeurs manquantes restent inconnues.
UIUClive-SWE-agent + Claude 4.5 Opus medium (20251101)
Résolu79.2%Coût par tâche réussieNon publiéPlage des résultats publiésNon publié
Détails de l’Agent
UIUClive-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
Résolu77.4%Coût par tâche réussieNon publiéPlage des résultats publiésNon publié
Détails de l’Agent
17 champs identiques ou entièrement non renseignés masqués
Système Agentlive-SWE-agent + Claude 4.5 Opus medium (20251101)live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
Configuration
Modèle de baseClaude 4.5 Opus medium (20251101)Gemini 3 Pro Preview (2025-11-18)
ID ou libellé du modèle sourceclaude-opus-4-5-20251101gemini-3-pro-preview
Résultat obtenu
Résolu79.2%77.4%
Confiance
Date de l’évaluation15 déc. 202520 nov. 2025
Source
Ouvrir la sourceOuvrir la sourceOuvrir la source

Configuration

live-SWE-agent + Claude 4.5 Opus medium (20251101)

Modèle de base
Claude 4.5 Opus medium (20251101)
ID ou libellé du modèle source
claude-opus-4-5-20251101

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

Modèle de base
Gemini 3 Pro Preview (2025-11-18)
ID ou libellé du modèle source
gemini-3-pro-preview

Résultat obtenu

live-SWE-agent + Claude 4.5 Opus medium (20251101)

Résolu
79.2%

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

Résolu
77.4%

Confiance

live-SWE-agent + Claude 4.5 Opus medium (20251101)

Date de l’évaluation
15 déc. 2025

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

Date de l’évaluation
20 nov. 2025

Source

Données déclarées par la source ; les valeurs manquantes restent inconnues.

Valider avant l’adoption

Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.

  1. 1

    Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.

  2. 2

    Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.

  3. 3

    Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.

  4. 4

    Examinez les échecs et les risques liés au traitement des données avant toute décision de production.

Annuaire et évaluations des Agents