AI-Agentenverzeichnis und Bewertungen

Finden Sie verifizierte Agentenprodukte und vergleichen Sie veröffentlichte Konfigurationen ausschließlich innerhalb desselben Benchmark-Umfangs.

Top 3 der BewertungSWE-bench Verified · Behoben · 10 Vergleichbare Konfigurationen
  1. Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. Rang 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. Rang 3TRAE + Doubao-Seed-CodeByteDance78.8%

Programmieren

Aufgabenkategorie auswählen
Snapshot und ÄnderungenEs ist noch kein früherer vergleichbarer Snapshot gespeichert.Aktueller Quell-Snapshot
  1. Rang 1
    Basismodell
    Claude 4.5 Opus medium (20251101)
    Agentengerüst
    live-SWE-agent
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    Nicht veröffentlicht
    Behoben
    79.2%
  2. Rang 1
    Basismodell
    Claude 4.5 Opus
    Agentengerüst
    Sonar Foundation Agent
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    Nicht veröffentlicht
    Behoben
    79.2%
  3. Rang 3
    Basismodell
    Doubao-Seed-Code + Doubao-Seed-1.6
    Agentengerüst
    TRAE
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    Nicht veröffentlicht
    Behoben
    78.8%
  4. Rang 4
    Basismodell
    Gemini 3 Pro Preview (2025-11-18)
    Agentengerüst
    live-SWE-agent
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    Nicht veröffentlicht
    Behoben
    77.4%
  5. Rang 5
    Basismodell
    Claude Sonnet 4 + GPT-5
    Agentengerüst
    Atlassian Rovo Dev
    Scaffold-Version
    2025-09-02
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    Nicht veröffentlicht
    Behoben
    76.8%
  6. Rang 5
    Basismodell
    Claude 4 Sonnet
    Agentengerüst
    EPAM AI/Run Developer Agent
    Scaffold-Version
    v20250719
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    Nicht veröffentlicht
    Behoben
    76.8%
  7. Rang 5
    Basismodell
    Claude 4.5 Opus (high reasoning)
    Agentengerüst
    mini-SWE-agent
    Scaffold-Version
    2.0.0
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    376,95 $
    Behoben
    76.8%
  8. Rang 8

    ACoder

    ACoder
    Basismodell
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Agentengerüst
    ACoder
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    Nicht veröffentlicht
    Behoben
    76.4%
  9. Rang 9
    Basismodell
    Gemini 3 Flash (high reasoning)
    Agentengerüst
    mini-SWE-agent
    Scaffold-Version
    2.0.0
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    177,98 $
    Behoben
    75.8%
  10. Rang 9
    Basismodell
    MiniMax M2.5 (high reasoning)
    Agentengerüst
    mini-SWE-agent
    Scaffold-Version
    2.0.0
    Evidenz aus wiederholten Durchläufen
    Nicht veröffentlicht
    Gemeldete Benchmark-Kosten
    36,64 $
    Behoben
    75.8%
Ergebnisse auf einen Blick
Ergebnisse auf einen BlickSWE-bench Verified · Aufgabenerfolg
  1. Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. Rang 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. Rang 3TRAE + Doubao-Seed-Code78.8%
  4. Rang 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. Rang 5Atlassian Rovo Dev (2025-09-02)76.8%
Veröffentlichte ErgebnisseSWE-bench VerifiedVerifiziert · Vollständige Rangliste · 500 AufgabenHistorische Nachweise
Datum der QuelldatenVon OpenGPT abgerufenLetzte RankingänderungNoch kein vergleichbarer VerlaufOpenGPT prüft diese Agent-Quelle mindestens einmal pro Woche.
QuellergebnisBehoben
Aufgaben500 · von Menschen validierte GitHub-Issues
NachweisstufeExterner Warnhinweis
Quelle öffnen
Nachweishinweis

Bewahren Sie diese Ergebnisse als historische Nachweise auf. Eine OpenAI-Prüfung von 2026 berichtete über Bedenken hinsichtlich Design und Kontamination bei SWE-bench Verified.

Audit öffnen
Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.