エージェント構成 · AssistantBench

Browser-Use · DeepSeek V3 (March 2025)

モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。

正解率2.03%
成功1件あたり費用$18.9
公開された結果範囲未公開

01

構成

エージェントシステムBrowser-Use · DeepSeek V3 (March 2025)
基盤モデルDeepSeek V3 (March 2025)
公開元のモデルIDまたは表記DeepSeek V3 (March 2025)
スキャフォールドBrowser-Use
スキャフォールド版未報告
ツールBrowser-Use live-web browser automation
環境Holistic Agent Leaderboardが再現したライブWeb調査・ブラウザ課題
予算公開元ごとに異なる · 共通のステップ・トークン上限は未公開

02

結果

正解率2.03%
部分スコア未公開
成功1件あたり費用$18.9
公開された総費用$12.66
完了時間の中央値未公開
人の介入未公開

03

運用

反復実行の根拠1回実行
公開された結果範囲未公開
安全上の注意未公開
比較グループhal-assistantbench-public-33-browser-use
評価日未公開
データ取得日

04

信頼性

根拠完全な公開実行記録
情報源Holistic Agent Leaderboard · AssistantBench
情報源スナップショットHAL検証済みスナップショット · 公開33課題 · 1スキャフォールド · 2026年7月30日
最終確認2026年7月30日
課題数33 自動検証可能な公開ブラウザ課題
根拠レベル外部の注意情報あり
根拠の注意

HALが公開行を再現し、軌跡、費用、実行回数を公開しています。新モデルの追加は停止中で、費用にキャッシュ効果は含まれないため、過去のスナップショットとして扱います。

監査情報

この結果で分からないこと

結果は表示されたシステムと条件にのみ適用されます。万能な最良エージェント、実運用品質、データ管理、別版での性能を証明しません。

同じ条件で比較

同じベンチマーク版とタスク範囲の構成だけを比較できます。

公開元のデータです。欠損値は不明のまま表示します。

導入前に実務で確認

公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。

  1. 1

    代表的な仕事を10〜20件選び、合格条件を決める。

  2. 2

    Agent、モデル、ツール、権限、予算を固定する。

  3. 3

    重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。

  4. 4

    失敗とデータ取扱いを確認してから導入を決める。

AIエージェントランキング