平均Pass¹81.01%成功1件あたり費用未公開公開された結果範囲未公開
詳細 →共通のベンチマーク範囲 · τ²-bench Core
同じベンチマークで比較
同じベンチマーク範囲の構成です。スキャフォールド、モデル版、日付、公開元の値をそのまま表示します。
値が高いことは、このベンチマーク条件での結果のみを示します。実運用品質や異なるベンチマークの総合点ではありません。
同じ条件で比較
判断概要
同じベンチマーク版とタスク範囲の構成だけを比較できます。
平均Pass¹87.91%成功1件あたり費用未公開公開された結果範囲未公開
詳細 →同一または全て未報告の18項目を非表示
| エージェントシステム | τ² standard agent · GLM-5 · thinking | τ² standard agent · Qwen3.5-397B-A17B · thinking |
|---|---|---|
| 構成 | ||
| 基盤モデル | GLM-5 | Qwen3.5-397B-A17B |
| 公開元のモデルIDまたは表記 | GLM-5 · thinking | Qwen3.5-397B-A17B · thinking |
| 結果 | ||
| 平均Pass¹ | 81.01% | 87.91% |
| 情報源 | ||
| 情報源を開く | 情報源を開く ↗ | 情報源を開く ↗ |
構成
τ² standard agent · GLM-5 · thinking
- 基盤モデル
- GLM-5
- 公開元のモデルIDまたは表記
- GLM-5 · thinking
τ² standard agent · Qwen3.5-397B-A17B · thinking
- 基盤モデル
- Qwen3.5-397B-A17B
- 公開元のモデルIDまたは表記
- Qwen3.5-397B-A17B · thinking
結果
τ² standard agent · GLM-5 · thinking
- 平均Pass¹
- 81.01%
τ² standard agent · Qwen3.5-397B-A17B · thinking
- 平均Pass¹
- 87.91%
情報源
公開元のデータです。欠損値は不明のまま表示します。
導入前に実務で確認
公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。
- 1
代表的な仕事を10〜20件選び、合格条件を決める。
- 2
Agent、モデル、ツール、権限、予算を固定する。
- 3
重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。
- 4
失敗とデータ取扱いを確認してから導入を決める。