Gedeeld benchmarkbereik · τ²-bench Core

Agentvergelijking binnen dezelfde benchmark

De onderstaande items delen hetzelfde benchmarkbereik. Hun exacte scaffolds, modelversies, datums en oorspronkelijke bronwaarden blijven zichtbaar.

Een hogere bronwaarde duidt uitsluitend op betere prestaties binnen deze benchmark en configuratie. Het is geen score die vergelijking tussen verschillende benchmarks mogelijk maakt van die iets zegt over de geschiktheid voor productiegebruik.

Vergelijk vergelijkbare zaken

Beslissingsoverzicht

Alleen configuraties uit dezelfde benchmarkversie en hetzelfde taakbereik kunnen in één vergelijking worden geplaatst.

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.
Zhipu AIτ² standard agent · GLM-5 · thinking
Gemiddeld geslaagd¹81.01%Kosten per geslaagde taakNiet gepubliceerdBereik van gepubliceerde resultatenNiet gepubliceerd
Agentdetails
Alibaba Cloudτ² standard agent · Qwen3.5-397B-A17B · thinking
Gemiddeld geslaagd¹87.91%Kosten per geslaagde taakNiet gepubliceerdBereik van gepubliceerde resultatenNiet gepubliceerd
Agentdetails
18 identieke van volledig niet-gerapporteerde velden verborgen
Agentsysteemτ² standard agent · GLM-5 · thinkingτ² standard agent · Qwen3.5-397B-A17B · thinking
Configuratie
BasismodelGLM-5Qwen3.5-397B-A17B
Model-ID van label uit bronGLM-5 · thinkingQwen3.5-397B-A17B · thinking
Resultaat
Gemiddeld geslaagd¹81.01%87.91%
Bron
Bron openenBron openenBron openen

Configuratie

τ² standard agent · GLM-5 · thinking

Basismodel
GLM-5
Model-ID van label uit bron
GLM-5 · thinking

τ² standard agent · Qwen3.5-397B-A17B · thinking

Basismodel
Qwen3.5-397B-A17B
Model-ID van label uit bron
Qwen3.5-397B-A17B · thinking

Resultaat

τ² standard agent · GLM-5 · thinking

Gemiddeld geslaagd¹
81.01%

τ² standard agent · Qwen3.5-397B-A17B · thinking

Gemiddeld geslaagd¹
87.91%

Bron

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.

Valideren vóór ingebruikname

Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt van de configuratie bij uw werk past.

  1. 1

    Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.

  2. 2

    Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.

  3. 3

    Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.

  4. 4

    Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.

Agentoverzicht en -evaluaties