Geprüfte Quellen:
AI-Agentenverzeichnis und Bewertungen
Finden Sie verifizierte Agentenprodukte und vergleichen Sie veröffentlichte Konfigurationen ausschließlich innerhalb desselben Benchmark-Umfangs.
- Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
- Rang 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
- Rang 3TRAE + Doubao-Seed-CodeByteDance78.8%
Verzeichnis der Agentenprodukte
Über Verzeichniseinträge
Eigenständige Agentensysteme mit einer verifizierten Erstanbieter-Produktseite, Dokumentationsseite oder einem entsprechenden Repository. Die Aufnahme in das Verzeichnis bestätigt Identität und offiziellen Zugangspunkt, nicht jedoch Leistung oder eine Empfehlung. Im nachstehenden Ranking erscheinen nur öffentliche Belege mit identischem Umfang.
Verifizierte Produkte
66Geprüfte Quellen:
Offizielle Quelle
Geprüfte Quellen:
Offizielle Quelle
Geprüfte Quellen:
Offizielle Quelle
Geprüfte Quellen:
Offizielle Quelle
Geprüfte Quellen:
Offizielle Quelle
Geprüfte Quellen:
Offizielle Quelle
Geprüfte Quellen:
Offizielle Quelle
Programmieren
- Rang 1
- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- Nicht veröffentlicht
Behoben79.2%Vom Benchmark-Herausgeber gelistetQuelle - Rang 1
- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- Nicht veröffentlicht
Behoben79.2%Vom Benchmark-Herausgeber gelistetQuelle - Rang 3
TRAE + Doubao-Seed-Code
ByteDance- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- Nicht veröffentlicht
Behoben78.8%Vom Benchmark-Herausgeber gelistetQuelle - Rang 4
- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- Nicht veröffentlicht
Behoben77.4%Vom Benchmark-Herausgeber gelistetQuelle - Rang 5
Atlassian Rovo Dev (2025-09-02)
Atlassian- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- Nicht veröffentlicht
Behoben76.8%Vom Benchmark-Herausgeber gelistetQuelle - Rang 5
- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- Nicht veröffentlicht
Behoben76.8%Vom Benchmark-Herausgeber gelistetQuelle - Rang 5
- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- 376,95 $
Behoben76.8%Vom Benchmark-Herausgeber gelistetQuelle - Rang 8
ACoder
ACoder- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- Nicht veröffentlicht
Behoben76.4%Vom Benchmark-Herausgeber gelistetQuelle - Rang 9
- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- 177,98 $
Behoben75.8%Vom Benchmark-Herausgeber gelistetQuelle - Rang 9
- Evidenz aus wiederholten Durchläufen
- Nicht veröffentlicht
- Gemeldete Benchmark-Kosten
- 36,64 $
Behoben75.8%Vom Benchmark-Herausgeber gelistetQuelle
Ergebnisse auf einen Blick
- Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
- Rang 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
- Rang 3TRAE + Doubao-Seed-Code78.8%
- Rang 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
- Rang 5Atlassian Rovo Dev (2025-09-02)76.8%
Nachweishinweis
Bewahren Sie diese Ergebnisse als historische Nachweise auf. Eine OpenAI-Prüfung von 2026 berichtete über Bedenken hinsichtlich Design und Kontamination bei SWE-bench Verified.
Audit öffnenVon der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.Vor der Einführung validieren
Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.
- 1
Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.
- 2
Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.
- 3
Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.
- 4
Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.