Gemeinsamer Benchmark-Umfang · SWE-bench Verified
Agentenvergleich innerhalb desselben Benchmarks
Die folgenden Einträge decken denselben Benchmark-Umfang ab. Ihre exakten Gerüste, Modellversionen, Daten und ursprünglichen Quellwerte bleiben sichtbar.
Ein höherer Ausgangswert bedeutet lediglich eine bessere Leistung bei diesem Benchmark und dieser Konfiguration. Es handelt sich nicht um einen Wert, der einen Vergleich über verschiedene Benchmarks hinweg ermöglicht oder Aufschluss über die Einsatzreife in der Produktion gibt.
Gleiches mit Gleichem vergleichen
Entscheidungsübersicht
Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.
| Agentensystem | live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) | live-SWE-agent + Claude 4.5 Opus medium (20251101) |
|---|---|---|
| Konfiguration | ||
| Basismodell | Gemini 3 Pro Preview (2025-11-18) | Claude 4.5 Opus medium (20251101) |
| Quellmodell-ID oder -bezeichnung | gemini-3-pro-preview | claude-opus-4-5-20251101 |
| Ergebnis | ||
| Behoben | 77.4% | 79.2% |
| Vertrauen | ||
| Bewertungsdatum | 20. Nov. 2025 | 15. Dez. 2025 |
| Quelle | ||
| Quelle öffnen | Quelle öffnen ↗ | Quelle öffnen ↗ |
Konfiguration
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- Basismodell
- Gemini 3 Pro Preview (2025-11-18)
- Quellmodell-ID oder -bezeichnung
- gemini-3-pro-preview
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- Basismodell
- Claude 4.5 Opus medium (20251101)
- Quellmodell-ID oder -bezeichnung
- claude-opus-4-5-20251101
Ergebnis
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- Behoben
- 77.4%
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- Behoben
- 79.2%
Vertrauen
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- Bewertungsdatum
- 20. Nov. 2025
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- Bewertungsdatum
- 15. Dez. 2025
Quelle
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
live-SWE-agent + Claude 4.5 Opus medium (20251101)
Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.
Vor der Einführung validieren
Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.
- 1
Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.
- 2
Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.
- 3
Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.
- 4
Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.