Agentconfiguratie · τ³-Banking Knowledge

τ³ Banking AllTools · Muse Spark 1.1 · xhigh

Het gerangschikte object: model, scaffold, hulpmiddelen, rechten, budget en omgeving samen.

Geslaagd¹40.46%
Kosten per geslaagde taakNiet gepubliceerd
Bereik van gepubliceerde resultatenNiet gepubliceerd

01

Configuratie

Agentsysteemτ³ Banking AllTools · Muse Spark 1.1 · xhigh
BasismodelMuse Spark 1.1
Model-ID of label uit bronMuse Spark 1.1 · xhigh
Scaffoldτ³ standard agent
Scaffoldversiev1.0.1
HulpmiddelenAllTools: BM25, text-embedding-3-large retrieval, and sandboxed shell
OmgevingStandaardscaffold met BM25, zoekopdrachten via embeddings en afgeschermd zoeken op de opdrachtregel
Budget4 pogingen per taak · 388 trajecten per configuratie

02

Resultaat

Geslaagd¹40.46%
Gedeeltelijke scoreNiet gepubliceerd
Kosten per geslaagde taakNiet gepubliceerd
Gerapporteerde benchmarkkostenNiet gerapporteerd
Mediane voltooiingstijdNiet gepubliceerd
Menselijke tussenkomstNiet gepubliceerd

03

Werking

Bewijs uit herhaalde uitvoeringen4 uitvoeringen
Bereik van gepubliceerde resultatenNiet gepubliceerd
VeiligheidsnotitieNiet gepubliceerd
Vergelijkbaarheidsgroeptau3-banking-v1-0-1-alltools-gpt-5-2-low-seed-300-4-trials
Evaluatiedatum
Gegevens vastgelegd

04

Vertrouwen

BewijsVermeld door de benchmarkuitgever
BronSierra Research · τ³-Banking
Bronmomentopnamev1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials
Datum van brongegevens
Opgehaald door OpenGPT
Rangschikking laatst gewijzigd
Laatst gecontroleerd
Taken97 banking-knowledge-taken
BewijsniveauOnderhouden door uitgever
Bewijsnotitie

Opgenomen rijen delen benchmark v1.0.1, de Banking Knowledge-splitsing met 97 taken, AllTools-configuratie, gebruikerssimulator, seed en protocol met vier pogingen. Ontbrekende kosten blijven onbekend.

Audit openen

Wat dit resultaat niet bewijst

Dit resultaat geldt voor het exacte systeem en de hier getoonde bronvoorwaarden. Het stelt geen universeel beste agent, productiebetrouwbaarheid, gegevensgovernance van prestaties op een andere benchmarkversie vast.

Vergelijk vergelijkbare zaken

Alleen configuraties uit dezelfde benchmarkversie en hetzelfde taakbereik kunnen in één vergelijking worden geplaatst.

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.

Valideren vóór ingebruikname

Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt van de configuratie bij uw werk past.

  1. 1

    Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.

  2. 2

    Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.

  3. 3

    Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.

  4. 4

    Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.

Agentoverzicht en -evaluaties