Agentconfiguratie · Terminal-Bench 2.1

Terminus 2 · Gemini 3.1 Pro · high

Het gerangschikte object: model, scaffold, hulpmiddelen, rechten, budget en omgeving samen.

Taaknauwkeurigheid65.6%
Kosten per geslaagde taakNiet gepubliceerd
Bereik van gepubliceerde resultaten±3.2%

01

Configuratie

AgentsysteemTerminus 2 · Gemini 3.1 Pro · high
BasismodelGemini 3.1 Pro
Model-ID of label uit bronGemini 3.1 Pro
ScaffoldTerminus 2
ScaffoldversieNiet gerapporteerd
HulpmiddelenTerminal shell
OmgevingDoor Harbor beheerde terminalomgevingen
BudgetVaste limieten · minimaal 5 pogingen per taak

02

Resultaat

Taaknauwkeurigheid65.6%
Gedeeltelijke scoreNiet gepubliceerd
Kosten per geslaagde taakNiet gepubliceerd
Gerapporteerde benchmarkkostenUS$ 229,99
Mediane voltooiingstijdNiet gepubliceerd
Menselijke tussenkomstNiet gepubliceerd

03

Werking

Bewijs uit herhaalde uitvoeringenNiet gepubliceerd
Bereik van gepubliceerde resultaten±3.2%
VeiligheidsnotitieNiet gepubliceerd
Vergelijkbaarheidsgroepterminal-bench-2-1-main
Evaluatiedatum
Gegevens vastgelegd

04

Vertrouwen

BewijsVermeld door de benchmarkuitgever
BronTerminal-Bench 2.1
BronmomentopnameTerminal-Bench 2.1 · door uitgever geverifieerde ranglijst
Datum van brongegevens
Opgehaald door OpenGPT
Rangschikking laatst gewijzigd
Laatst gecontroleerd
Taken89 terminaltaken
BewijsniveauOnderhouden door uitgever
Bewijsnotitie

Het Terminal-Bench-team zegt deze inzendingen te hebben uitgevoerd en geverifieerd. De 2.1-release heeft taken en de evaluatieomgeving herzien.

Audit openen

Wat dit resultaat niet bewijst

Dit resultaat geldt voor het exacte systeem en de hier getoonde bronvoorwaarden. Het stelt geen universeel beste agent, productiebetrouwbaarheid, gegevensgovernance van prestaties op een andere benchmarkversie vast.

Vergelijk vergelijkbare zaken

Alleen configuraties uit dezelfde benchmarkversie en hetzelfde taakbereik kunnen in één vergelijking worden geplaatst.

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.

Valideren vóór ingebruikname

Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt van de configuratie bij uw werk past.

  1. 1

    Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.

  2. 2

    Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.

  3. 3

    Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.

  4. 4

    Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.

Agentoverzicht en -evaluaties