平均Pass¹81.01%每次成功成本未公布來源公布的結果範圍未公布
Agent詳情 →共同評測範圍 · τ²-bench Core
同評測Agent比較
以下配置來自同一個評測範圍,並保留各自的框架、模型版本、日期與來源原始值。
來源值較高只代表此評測與配置下的結果,不是跨評測總分,也不代表已適合正式使用。
只比較相同範圍
決策概覽
只有評測版本與工作範圍一致的配置,才能加入同一組比較。
平均Pass¹87.91%每次成功成本未公布來源公布的結果範圍未公布
Agent詳情 →已隱藏18項完全相同或全部未提供的欄位
| Agent系統 | τ² standard agent · GLM-5 · thinking | τ² standard agent · Qwen3.5-397B-A17B · thinking |
|---|---|---|
| 配置 | ||
| 基礎模型 | GLM-5 | Qwen3.5-397B-A17B |
| 來源模型ID或名稱 | GLM-5 · thinking | Qwen3.5-397B-A17B · thinking |
| 結果 | ||
| 平均Pass¹ | 81.01% | 87.91% |
| 資料來源 | ||
| 開啟來源 | 開啟來源 ↗ | 開啟來源 ↗ |
配置
τ² standard agent · GLM-5 · thinking
- 基礎模型
- GLM-5
- 來源模型ID或名稱
- GLM-5 · thinking
τ² standard agent · Qwen3.5-397B-A17B · thinking
- 基礎模型
- Qwen3.5-397B-A17B
- 來源模型ID或名稱
- Qwen3.5-397B-A17B · thinking
結果
τ² standard agent · GLM-5 · thinking
- 平均Pass¹
- 81.01%
τ² standard agent · Qwen3.5-397B-A17B · thinking
- 平均Pass¹
- 87.91%
資料來源
資料來自公開來源,缺少項目保持未知。
採用前做一次真實驗證
公開榜單用於縮小候選範圍,是否適合你的工作,需要透過小規模私有測試確認。
- 1
選擇 10–20 個代表性工作,並寫清通過條件。
- 2
測試前鎖定Agent、模型、工具、權限與預算。
- 3
重要工作重複執行,記錄成功率、成本、時間與人工接管。
- 4
檢查失敗案例與資料風險後,再決定是否正式採用。