Agentenkonfiguration · τ²-bench Core

τ² standard agent · GPT-5.2 · high

Das eingeordnete Objekt: Modell, Gerüst, Tools, Berechtigungen, Budget und Umgebung als Einheit.

Durchschnittliche Erfolgsquote¹84.76%
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht

01

Konfiguration

Agentensystemτ² standard agent · GPT-5.2 · high
BasismodellGPT-5.2
Quellmodell-ID oder -bezeichnungGPT-5.2 · high
Agentengerüstτ² standard agent
Scaffold-Versionv1.0.1
WerkzeugeStandard retail, airline, and telecom domain tools
UmgebungStandard agent und Domänen-Tools · gemeinsam genutzter GPT-5.2 low-reasoning user simulator
Budget4 Durchläufe pro Aufgabe · 1.112 Trajektorien pro Konfiguration

02

Ergebnis

Durchschnittliche Erfolgsquote¹84.76%
TeilpunktzahlNicht veröffentlicht
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Gemeldete Benchmark-KostenNicht gemeldet
Mediane AbschlusszeitNicht veröffentlicht
Menschliches EingreifenNicht veröffentlicht

03

Vorgang

Evidenz aus wiederholten Durchläufen4 Durchläufe
Veröffentlichte ErgebnisspanneNicht veröffentlicht
SicherheitshinweisNicht veröffentlicht
Vergleichbarkeitsgruppetau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
Bewertungsdatum
Daten erfasst

04

Vertrauen

NachweisVom Benchmark-Herausgeber gelistet
QuelleSierra Research · τ²-bench
Quellsnapshotv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
Datum der Quelldaten
Von OpenGPT abgerufen
Letzte RankingänderungNoch kein vergleichbarer Verlauf
Zuletzt geprüft
Aufgaben278 Basisaufgaben aus Einzelhandel, Luftfahrt und Telekommunikation
NachweisstufeVom Herausgeber gepflegt
Nachweishinweis

Enthalten sind nur acht vom Herausgeber eingereichte Zeilen mit demselben Benchmark v1.0.1, dem Standard-Scaffold und den Standardtools, demselben Nutzersimulator, denselben grundlegenden Aufgabenaufteilungen und einem Protokoll mit vier Durchläufen. Andere τ-bench-Zeilen bleiben außerhalb dieses Umfangs.

Audit öffnen

Was dieses Ergebnis nicht nachweist

Dieses Ergebnis gilt für das hier gezeigte exakte System und die angegebenen Quellbedingungen. Es weist weder einen universell besten Agenten noch Produktionstauglichkeit, Daten-Governance oder Leistung mit einer anderen Benchmark-Version nach.

Gleiches mit Gleichem vergleichen

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen