Agentenkonfiguration · AssistantBench

Browser-Use · Gemini 2.0 Flash (February 2025)

Das eingeordnete Objekt: Modell, Gerüst, Tools, Berechtigungen, Budget und Umgebung als Einheit.

Genauigkeit2.62%
Kosten pro erfolgreich erledigter Aufgabe2,52 $
Veröffentlichte ErgebnisspanneNicht veröffentlicht

01

Konfiguration

AgentensystemBrowser-Use · Gemini 2.0 Flash (February 2025)
BasismodellGemini 2.0 Flash (February 2025)
Quellmodell-ID oder -bezeichnungGemini 2.0 Flash (February 2025)
AgentengerüstBrowser-Use
Scaffold-VersionNicht gemeldet
WerkzeugeBrowser-Use live-web browser automation
UmgebungVom Holistic Agent Leaderboard reproduzierte Live-Web-Recherche- und Browsing-Aufgaben
BudgetQuellspezifisch · kein normalisiertes Schritt- oder Tokenlimit veröffentlicht

02

Ergebnis

Genauigkeit2.62%
TeilpunktzahlNicht veröffentlicht
Kosten pro erfolgreich erledigter Aufgabe2,52 $
Gemeldete Benchmark-Kosten2,18 $
Mediane AbschlusszeitNicht veröffentlicht
Menschliches EingreifenNicht veröffentlicht

03

Vorgang

Evidenz aus wiederholten Durchläufen1 Durchläufe
Veröffentlichte ErgebnisspanneNicht veröffentlicht
SicherheitshinweisNicht veröffentlicht
Vergleichbarkeitsgruppehal-assistantbench-public-33-browser-use
BewertungsdatumNicht veröffentlicht
Daten erfasst

04

Vertrauen

NachweisVollständiger öffentlicher Durchlaufeintrag
QuelleHolistic Agent Leaderboard · AssistantBench
QuellsnapshotVon HAL verifizierter Snapshot · 33 öffentliche Aufgaben · 1 Scaffold
Datum der QuelldatenVon der Quelle nicht veröffentlicht
Von OpenGPT abgerufen
Letzte RankingänderungNoch kein vergleichbarer Verlauf
Zuletzt geprüft
Aufgaben33 öffentliche, automatisch verifizierbare Browseraufgaben
NachweisstufeExterner Warnhinweis
Nachweishinweis

HAL hat diese öffentlichen Zeilen reproduziert und veröffentlicht Traces, Kosten und Anzahlen der Durchläufe. Behandeln Sie den Snapshot als historisch: HAL hat die Aufnahme neuer Modelle ausgesetzt, und die angegebenen Kosten berücksichtigen keine Vorteile durch Caching.

Audit öffnen

Was dieses Ergebnis nicht nachweist

Dieses Ergebnis gilt für das hier gezeigte exakte System und die angegebenen Quellbedingungen. Es weist weder einen universell besten Agenten noch Produktionstauglichkeit, Daten-Governance oder Leistung mit einer anderen Benchmark-Version nach.

Gleiches mit Gleichem vergleichen

Nur Konfigurationen derselben Benchmark-Version und desselben Aufgabenumfangs können in einem Vergleich gegenübergestellt werden.

Von der Quelle gemeldete Daten; fehlende Werte bleiben unbekannt.

Vor der Einführung validieren

Öffentliche Rankings erstellen eine Vorauswahl. Ein kleiner privater Test zeigt, ob die Konfiguration zu Ihrer Arbeit passt.

  1. 1

    Wählen Sie 10–20 repräsentative Aufgaben und definieren Sie eine klare Bestehensbedingung.

  2. 2

    Legen Sie Agent, Modell, Tools, Berechtigungen und Budget vor dem Test fest.

  3. 3

    Führen Sie jede wichtige Aufgabe mehrmals aus; erfassen Sie Erfolg, Kosten, Zeit und menschliche Übernahmen.

  4. 4

    Fehler und Risiken bei der Datenverarbeitung vor einer Produktionsentscheidung prüfen.

Agentenverzeichnis und -bewertungen