Agentenkonfiguration · Terminal-Bench 2.1

Terminus 2 · GPT-5.5 · xhigh

Das eingeordnete Objekt: Modell, Gerüst, Tools, Berechtigungen, Budget und Umgebung als Einheit.

Aufgabengenauigkeit78.0%
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Veröffentlichte Ergebnisspanne±2.4%

01

Konfiguration

AgentensystemTerminus 2 · GPT-5.5 · xhigh
BasismodellGPT-5.5
Quellmodell-ID oder -bezeichnungGPT-5.5
AgentengerüstTerminus 2
Scaffold-VersionNicht gemeldet
WerkzeugeTerminal shell
UmgebungVon Harbor verwaltete Terminalumgebungen
BudgetFeste Limits · mindestens 5 Versuche pro Aufgabe

02

Ergebnis

Aufgabengenauigkeit78.0%
TeilpunktzahlNicht veröffentlicht
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Gemeldete Benchmark-Kosten493,85 $
Mediane AbschlusszeitNicht veröffentlicht
Menschliches EingreifenNicht veröffentlicht

03

Vorgang

Evidenz aus wiederholten DurchläufenNicht veröffentlicht
Veröffentlichte Ergebnisspanne±2.4%
SicherheitshinweisNicht veröffentlicht
Vergleichbarkeitsgruppeterminal-bench-2-1-main
Bewertungsdatum
Daten erfasst

04

Vertrauen

NachweisVom Benchmark-Herausgeber gelistet
QuelleTerminal-Bench 2.1
QuellsnapshotTerminal-Bench 2.1 · vom Herausgeber verifizierte Rangliste
Datum der Quelldaten
Von OpenGPT abgerufen
Letzte Rankingänderung
Zuletzt geprüft
Aufgaben89 Terminalaufgaben
NachweisstufeVom Herausgeber gepflegt
Nachweishinweis

Das Terminal-Bench-Team gibt an, diese Einreichungen ausgeführt und verifiziert zu haben. Für Version 2.1 wurden die Aufgaben und die Bewertungsumgebung überarbeitet.

Audit öffnen

Was dieses Ergebnis nicht nachweist

Dieses Ergebnis gilt für das hier gezeigte exakte System und die angegebenen Quellbedingungen. Es weist weder einen universell besten Agenten noch Produktionstauglichkeit, Daten-Governance oder Leistung mit einer anderen Benchmark-Version nach.

Gleiches mit Gleichem vergleichen

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen