Agentenkonfiguration · SWE-bench Verified

TRAE + Doubao-Seed-Code

Das eingeordnete Objekt: Modell, Gerüst, Tools, Berechtigungen, Budget und Umgebung als Einheit.

Quelle öffnen
Behoben78.8%
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht

01

Konfiguration

AgentensystemTRAE + Doubao-Seed-Code
BasismodellDoubao-Seed-Code + Doubao-Seed-1.6
Quellmodell-ID oder -bezeichnungDoubao-Seed-Code; Doubao-Seed-1.6
AgentengerüstTRAE
Scaffold-VersionNicht gemeldet
WerkzeugeNicht gemeldet
UmgebungVon SWE-bench evaluierte reproduzierbare Repository-Umgebungen
BudgetLimits unterscheiden sich je nach eingereichter Konfiguration

02

Ergebnis

Behoben78.8%
TeilpunktzahlNicht veröffentlicht
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Gemeldete Benchmark-KostenNicht gemeldet
Mediane AbschlusszeitNicht veröffentlicht
Menschliches EingreifenNicht veröffentlicht

03

Vorgang

Evidenz aus wiederholten DurchläufenNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht
SicherheitshinweisNicht veröffentlicht
Vergleichbarkeitsgruppeswe-bench-verified-full-500
Bewertungsdatum
Daten erfasst

04

Vertrauen

NachweisVom Benchmark-Herausgeber gelistet
QuelleSWE-bench Verified
QuellsnapshotVerifiziert · Vollständige Rangliste · 500 Aufgaben
Datum der Quelldaten
Von OpenGPT abgerufen
Letzte RankingänderungNoch kein vergleichbarer Verlauf
Zuletzt geprüft
Aufgaben500 von Menschen validierte GitHub-Issues
NachweisstufeExterner Warnhinweis
Nachweishinweis

Bewahren Sie diese Ergebnisse als historische Nachweise auf. Eine OpenAI-Prüfung von 2026 berichtete über Bedenken hinsichtlich Design und Kontamination bei SWE-bench Verified.

Audit öffnen

Was dieses Ergebnis nicht nachweist

Dieses Ergebnis gilt für das hier gezeigte exakte System und die angegebenen Quellbedingungen. Es weist weder einen universell besten Agenten noch Produktionstauglichkeit, Daten-Governance oder Leistung mit einer anderen Benchmark-Version nach.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen