Périmètre de benchmark partagé · SWE-bench Verified
Comparaison d’agents au sein du même benchmark
Les entrées ci-dessous relèvent du même périmètre de benchmark. Leurs échafaudages, versions de modèles, dates et valeurs sources d’origine exacts restent visibles.
Une valeur source plus élevée indique uniquement de meilleures performances pour ce benchmark et cette configuration. Il ne s’agit ni d’un score comparable entre benchmarks ni d’un indicateur d’aptitude à la production.
Comparer ce qui est comparable
Vue d’ensemble de la décision
Seules les configurations appartenant à la même version du benchmark et au même périmètre de tâches peuvent être réunies dans une comparaison.
| Système Agent | live-SWE-agent + Claude 4.5 Opus medium (20251101) | live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) |
|---|---|---|
| Configuration | ||
| Modèle de base | Claude 4.5 Opus medium (20251101) | Gemini 3 Pro Preview (2025-11-18) |
| ID ou libellé du modèle source | claude-opus-4-5-20251101 | gemini-3-pro-preview |
| Résultat obtenu | ||
| Résolu | 79.2% | 77.4% |
| Confiance | ||
| Date de l’évaluation | 15 déc. 2025 | 20 nov. 2025 |
| Source | ||
| Ouvrir la source | Ouvrir la source ↗ | Ouvrir la source ↗ |
Configuration
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- Modèle de base
- Claude 4.5 Opus medium (20251101)
- ID ou libellé du modèle source
- claude-opus-4-5-20251101
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- Modèle de base
- Gemini 3 Pro Preview (2025-11-18)
- ID ou libellé du modèle source
- gemini-3-pro-preview
Résultat obtenu
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- Résolu
- 79.2%
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- Résolu
- 77.4%
Confiance
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- Date de l’évaluation
- 15 déc. 2025
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- Date de l’évaluation
- 20 nov. 2025
Source
live-SWE-agent + Claude 4.5 Opus medium (20251101)
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
Données déclarées par la source ; les valeurs manquantes restent inconnues.
Valider avant l’adoption
Les classements publics permettent d’établir une présélection. Un petit essai privé détermine si la configuration convient à vos tâches.
- 1
Choisissez 10 à 20 tâches représentatives et définissez une condition de réussite claire.
- 2
Verrouillez l’agent, le modèle, les outils, les autorisations et le budget avant le test.
- 3
Exécutez chaque tâche importante plusieurs fois ; consignez la réussite, le coût, la durée et les reprises en main.
- 4
Examinez les échecs et les risques liés au traitement des données avant toute décision de production.