Agentenkonfiguration · τ³-Banking Knowledge

τ³ Banking AllTools · Kimi K3 · max

Das eingeordnete Objekt: Modell, Gerüst, Tools, Berechtigungen, Budget und Umgebung als Einheit.

Bestanden¹37.11%
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Veröffentlichte ErgebnisspanneNicht veröffentlicht

01

Konfiguration

Agentensystemτ³ Banking AllTools · Kimi K3 · max
BasismodellKimi K3
Quellmodell-ID oder -bezeichnungKimi K3 · max
Agentengerüstτ³ standard agent
Scaffold-Versionv1.0.1
WerkzeugeAllTools: BM25, text-embedding-3-large retrieval, and sandboxed shell
UmgebungStandard-Scaffold mit BM25, Embedding-Retrieval und einer isolierten Befehlszeilensuche
Budget4 Durchläufe pro Aufgabe · 388 Trajektorien pro Konfiguration

02

Ergebnis

Bestanden¹37.11%
TeilpunktzahlNicht veröffentlicht
Kosten pro erfolgreich erledigter AufgabeNicht veröffentlicht
Gemeldete Benchmark-KostenNicht gemeldet
Mediane AbschlusszeitNicht veröffentlicht
Menschliches EingreifenNicht veröffentlicht

03

Vorgang

Evidenz aus wiederholten Durchläufen4 Durchläufe
Veröffentlichte ErgebnisspanneNicht veröffentlicht
SicherheitshinweisNicht veröffentlicht
Vergleichbarkeitsgruppetau3-banking-v1-0-1-alltools-gpt-5-2-low-seed-300-4-trials
Bewertungsdatum
Daten erfasst

04

Vertrauen

NachweisVom Benchmark-Herausgeber gelistet
QuelleSierra Research · τ³-Banking
Quellsnapshotv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials
Datum der Quelldaten
Von OpenGPT abgerufen
Letzte Rankingänderung
Zuletzt geprüft
Aufgaben97 Aufgaben zu Bankwissen
NachweisstufeVom Herausgeber gepflegt
Nachweishinweis

Die enthaltenen Zeilen verwenden gemeinsam Benchmark v1.0.1, den 97 Aufgaben umfassenden Banking-Knowledge-Split, das AllTools-Setup, den Benutzersimulator, den Seed und das Vier-Versuche-Protokoll. Fehlende Kosten bleiben unbekannt.

Audit öffnen

Was dieses Ergebnis nicht nachweist

Dieses Ergebnis gilt für das hier gezeigte exakte System und die angegebenen Quellbedingungen. Es weist weder einen universell besten Agenten noch Produktionstauglichkeit, Daten-Governance oder Leistung mit einer anderen Benchmark-Version nach.

Gleiches mit Gleichem vergleichen

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen