Gemeinsamer Benchmark-Umfang · SWE-bench Verified

Agentenvergleich innerhalb desselben Benchmarks

Die folgenden Einträge decken denselben Benchmark-Umfang ab. Ihre exakten Gerüste, Modellversionen, Daten und ursprünglichen Quellwerte bleiben sichtbar.

Ein höherer Ausgangswert bedeutet lediglich eine bessere Leistung bei diesem Benchmark und dieser Konfiguration. Es handelt sich nicht um einen Wert, der einen Vergleich über verschiedene Benchmarks hinweg ermöglicht oder Aufschluss über die Einsatzreife in der Produktion gibt.

Gleiches mit Gleichem vergleichen

Entscheidungsübersicht

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.
UIUClive-SWE-agent + Claude 4.5 Opus medium (20251101)
Behoben79.2%Kosten pro erfolgreich erledigter AufgabeNicht veröffentlichtVeröffentlichte ErgebnisspanneNicht veröffentlicht
Agentendetails
UIUClive-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
Behoben77.4%Kosten pro erfolgreich erledigter AufgabeNicht veröffentlichtVeröffentlichte ErgebnisspanneNicht veröffentlicht
Agentendetails
17 – Identische oder nicht gemeldete Felder ausgeblendet
Agentensystemlive-SWE-agent + Claude 4.5 Opus medium (20251101)live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
Konfiguration
BasismodellClaude 4.5 Opus medium (20251101)Gemini 3 Pro Preview (2025-11-18)
Quellmodell-ID oder -bezeichnungclaude-opus-4-5-20251101gemini-3-pro-preview
Ergebnis
Behoben79.2%77.4%
Vertrauen
Bewertungsdatum15. Dez. 202520. Nov. 2025
Quelle
Quelle öffnenQuelle öffnenQuelle öffnen

Konfiguration

live-SWE-agent + Claude 4.5 Opus medium (20251101)

Basismodell
Claude 4.5 Opus medium (20251101)
Quellmodell-ID oder -bezeichnung
claude-opus-4-5-20251101

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

Basismodell
Gemini 3 Pro Preview (2025-11-18)
Quellmodell-ID oder -bezeichnung
gemini-3-pro-preview

Ergebnis

live-SWE-agent + Claude 4.5 Opus medium (20251101)

Behoben
79.2%

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

Behoben
77.4%

Vertrauen

live-SWE-agent + Claude 4.5 Opus medium (20251101)

Bewertungsdatum
15. Dez. 2025

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

Bewertungsdatum
20. Nov. 2025

Quelle

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen