工作成功率83.1%
每次成功成本未公布
來源公布的結果範圍±1.1%
01
配置
Agent系統Codex · GPT-5.5 · xhigh
基礎模型GPT-5.5
來源模型ID或名稱GPT-5.5
Agent框架Codex
Agent框架版本未提供
工具Terminal shell
執行環境由Harbor管理的終端環境
預算固定限制 · 每項工作至少執行 5 次
02
結果
工作成功率83.1%
部分完成分未公布
每次成功成本未公布
來源公布的評測總成本US$2,059.19
完成時間中位數未公布
人工介入率未公布
03
執行情況
重複執行證據未公布
來源公布的結果範圍±1.1%
安全提示未公布
可比較組terminal-bench-2-1-main
評測日期
資料取得日期
04
可信度
證據狀態已列入基準官方榜單
資料來源Terminal-Bench 2.1
資料快照Terminal-Bench 2.1 · 發布方核驗榜單 · 2026年7月30日
最近核查2026年7月30日
工作數89 終端工作
證據等級發布方維護
證據說明
稽核說明 ↗Terminal-Bench團隊說明這些提交由其執行並核驗;2.1 版本調整了工作與評測環境。
此結果不能說明什麼
結果只適用於此處顯示的完整系統與來源條件,不能證明萬用Agent、正式環境可靠性、資料治理或其他版本的表現。
資料來自公開來源,缺少項目保持未知。
採用前做一次真實驗證
公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。
- 1
選擇 10–20 個代表性工作,並寫清通過條件。
- 2
測試前鎖定Agent、模型、工具、權限與預算。
- 3
重要工作重複執行,記錄成功率、成本、時間與人工接管。
- 4
檢查失敗案例與資料風險後,再決定是否正式採用。