Agentconfiguratie · AssistantBench

Browser-Use · Claude Opus 4.1 (August 2025)

Het gerangschikte object: model, scaffold, hulpmiddelen, rechten, budget en omgeving samen.

Nauwkeurigheid7.26%
Kosten per geslaagde taakUS$ 160,88
Bereik van gepubliceerde resultatenNiet gepubliceerd

01

Configuratie

AgentsysteemBrowser-Use · Claude Opus 4.1 (August 2025)
BasismodelClaude Opus 4.1 (August 2025)
Model-ID of label uit bronClaude Opus 4.1 (August 2025)
ScaffoldBrowser-Use
ScaffoldversieNiet gerapporteerd
HulpmiddelenBrowser-Use live-web browser automation
OmgevingLive onderzoek op internet en browsertaken gereproduceerd door de Holistic Agent Leaderboard
BudgetBronspecifiek · geen genormaliseerde stap- of tokenlimiet gepubliceerd

02

Resultaat

Nauwkeurigheid7.26%
Gedeeltelijke scoreNiet gepubliceerd
Kosten per geslaagde taakUS$ 160,88
Gerapporteerde benchmarkkostenUS$ 385,43
Mediane voltooiingstijdNiet gepubliceerd
Menselijke tussenkomstNiet gepubliceerd

03

Werking

Bewijs uit herhaalde uitvoeringen1 uitvoeringen
Bereik van gepubliceerde resultatenNiet gepubliceerd
VeiligheidsnotitieNiet gepubliceerd
Vergelijkbaarheidsgroephal-assistantbench-public-33-browser-use
EvaluatiedatumNiet gepubliceerd
Gegevens vastgelegd

04

Vertrouwen

BewijsVolledig openbaar uitvoeringsrecord
BronHolistic Agent Leaderboard · AssistantBench
BronmomentopnameDoor HAL geverifieerde momentopname · 33 openbare taken · 1 scaffold
Datum van brongegevensNiet gepubliceerd door de bron
Opgehaald door OpenGPT
Rangschikking laatst gewijzigdNog geen vergelijkbare geschiedenis
Laatst gecontroleerd
Taken33 openbare, automatisch verifieerbare browsertaken
BewijsniveauExterne waarschuwing
Bewijsnotitie

HAL heeft deze openbare rijen gereproduceerd en publiceert traces, kosten en aantallen uitvoeringen. Beschouw de momentopname als Historisch: HAL heeft nieuwe modellen gepauzeerd en de gerapporteerde kosten sluiten voordelen van caching uit.

Audit openen

Wat dit resultaat niet bewijst

Dit resultaat geldt voor het exacte systeem en de hier getoonde bronvoorwaarden. Het stelt geen universeel beste agent, productiebetrouwbaarheid, gegevensgovernance van prestaties op een andere benchmarkversie vast.

Vergelijk vergelijkbare zaken

Alleen configuraties uit dezelfde benchmarkversie en hetzelfde taakbereik kunnen in één vergelijking worden geplaatst.

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.

Valideren vóór ingebruikname

Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt van de configuratie bij uw werk past.

  1. 1

    Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.

  2. 2

    Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.

  3. 3

    Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.

  4. 4

    Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.

Agentoverzicht en -evaluaties