Agent配置 · AssistantBench
Browser-Use · Claude Opus 4.1 (August 2025)
榜單評估的完整對象,包括模型、框架、工具、權限、預算與執行環境。
準確率7.26%
每次成功成本US$160.88
來源公布的結果範圍未公布
01
配置
Agent系統Browser-Use · Claude Opus 4.1 (August 2025)
基礎模型Claude Opus 4.1 (August 2025)
來源模型ID或名稱Claude Opus 4.1 (August 2025)
Agent框架Browser-Use
Agent框架版本未提供
工具Browser-Use live-web browser automation
執行環境由Holistic Agent Leaderboard重現的即時網頁研究與瀏覽工作
預算取決於來源 · 未公布統一步驟或Token上限
02
結果
準確率7.26%
部分完成分未公布
每次成功成本US$160.88
來源公布的評測總成本US$385.43
完成時間中位數未公布
人工介入率未公布
03
執行情況
重複執行證據1 次執行
來源公布的結果範圍未公布
安全提示未公布
可比較組hal-assistantbench-public-33-browser-use
評測日期未公布
資料取得日期
04
可信度
證據狀態完整公開執行記錄
資料來源Holistic Agent Leaderboard · AssistantBench
資料快照HAL核驗快照 · 33 個公開工作 · 1 個Agent框架 · 2026年7月30日
最近核查2026年7月30日
工作數33 可自動核驗的公開瀏覽器工作
證據等級存在外部審計提示
證據說明
HAL重現了這些公開資料,並提供執行軌跡、成本與執行次數。由於HAL已暫停加入新模型,且成本未計入快取效益,應視為歷史快照。
稽核說明 ↗此結果不能說明什麼
結果只適用於此處顯示的完整系統與來源條件,不能證明萬用Agent、正式環境可靠性、資料治理或其他版本的表現。
資料來自公開來源,缺少項目保持未知。
採用前做一次真實驗證
公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。
- 1
選擇 10–20 個代表性工作,並寫清通過條件。
- 2
測試前鎖定Agent、模型、工具、權限與預算。
- 3
重要工作重複執行,記錄成功率、成本、時間與人工接管。
- 4
檢查失敗案例與資料風險後,再決定是否正式採用。