Agent 配置 · OSWorld 2.0
OSWorld Agent · Claude Opus 4.8 · Max · Standard
榜單評估的完整對象,包括模型、框架、工具、權限、預算與執行環境。
完全完成率18.52%
每次成功成本未公布
來源公布的結果範圍未公布
01
配置
Agent 系統OSWorld Agent · Claude Opus 4.8 · Max · Standard
基礎模型Claude Opus 4.8
來源模型 ID 或名稱Claude Opus 4.8
Agent 框架OSWorld 2.0 computer-use agent
Agent 框架版本OSWorld 2.0
工具Standard computer-use tool
執行環境可重現虛擬機中的桌面與作業系統工作
預算500 步
02
結果
完全完成率18.52%
部分完成分49.33%
每次成功成本未公布
來源公布的評測總成本未提供
完成時間中位數未公布
人工介入率未公布
03
執行情況
重複執行證據未公布
來源公布的結果範圍未公布
安全提示未公布
可比較組osworld-2-v2026-06-24-500
評測日期
資料取得日期
04
可信度
證據狀態已列入基準官方榜單
資料來源OSWorld 2.0
資料快照工作版本 v2026.06.24 · 500 步上限
來源資料日
OpenGPT 取得時間
排名最後變化暫無可比歷史
最近核查
工作數108 長流程電腦操作工作
證據等級發布方維護
證據說明
資料保留了 Agent、模型、工具模式、工作版本、步驟上限與來源指標。
稽核說明 ↗此結果不能說明什麼
結果只適用於此處顯示的完整系統與來源條件,不能證明萬用 Agent、正式環境可靠性、資料治理或其他版本的表現。
資料來自公開來源,缺少項目保持未知。
採用前做一次真實驗證
公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。
- 1
選擇 10–20 個代表性工作,並寫清通過條件。
- 2
測試前鎖定 Agent、模型、工具、權限與預算。
- 3
重要工作重複執行,記錄成功率、成本、時間與人工接管。
- 4
檢查失敗案例與資料風險後,再決定是否正式採用。