Agent配置 · GAIA

HAL Generalist Agent · Claude Haiku 4.5 (October 2025)

榜單評估的完整對象,包括模型、框架、工具、權限、預算與執行環境。

準確率56.36%
每次成功成本US$1.41
來源公布的結果範圍未公布

01

配置

Agent系統HAL Generalist Agent · Claude Haiku 4.5 (October 2025)
基礎模型Claude Haiku 4.5 (October 2025)
來源模型ID或名稱Claude Haiku 4.5 (October 2025)
Agent框架HAL Generalist Agent
Agent框架版本未提供
工具未提供
執行環境需要推理、多模態、瀏覽器與工具的通用助手工作
預算取決於來源 · 未公布統一步驟或Token上限

02

結果

準確率56.36%
部分完成分未公布
每次成功成本US$1.41
來源公布的評測總成本US$130.81
完成時間中位數未公布
人工介入率未公布

03

執行情況

重複執行證據1 次執行
來源公布的結果範圍未公布
安全提示未公布
可比較組hal-gaia-public-validation-165
評測日期未公布
資料取得日期

04

可信度

證據狀態完整公開執行記錄
資料來源Holistic Agent Leaderboard · GAIA
資料快照HAL核驗快照 · 公開驗證集 · 165 個問題 · 2026年7月30日
最近核查2026年7月30日
工作數165 公開驗證問題
證據等級存在外部審計提示
證據說明

HAL重現了公開驗證集資料,並提供框架、模型、成績、成本、執行次數與軌跡。來源沒有統一公布工具或步驟上限,應視為歷史快照。

稽核說明

此結果不能說明什麼

結果只適用於此處顯示的完整系統與來源條件,不能證明萬用Agent、正式環境可靠性、資料治理或其他版本的表現。

只比較相同範圍

只有評測版本與工作範圍一致的配置,才能加入同一組比較。

資料來自公開來源,缺少項目保持未知。

採用前做一次真實驗證

公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。

  1. 1

    選擇 10–20 個代表性工作,並寫清通過條件。

  2. 2

    測試前鎖定Agent、模型、工具、權限與預算。

  3. 3

    重要工作重複執行,記錄成功率、成本、時間與人工接管。

  4. 4

    檢查失敗案例與資料風險後,再決定是否正式採用。

全部AI Agent榜單