共通のベンチマーク範囲 · τ²-bench Core

同じベンチマークで比較

同じベンチマーク範囲の構成です。スキャフォールド、モデル版、日付、公開元の値をそのまま表示します。

値が高いことは、このベンチマーク条件での結果のみを示します。実運用品質や異なるベンチマークの総合点ではありません。

同じ条件で比較

判断概要

同じベンチマーク版とタスク範囲の構成だけを比較できます。

公開元のデータです。欠損値は不明のまま表示します。
Zhipu AIτ² standard agent · GLM-5 · thinking
平均Pass¹81.01%成功1件あたり費用未公開公開された結果範囲未公開
詳細
Alibaba Cloudτ² standard agent · Qwen3.5-397B-A17B · thinking
平均Pass¹87.91%成功1件あたり費用未公開公開された結果範囲未公開
詳細
同一または全て未報告の18項目を非表示
エージェントシステムτ² standard agent · GLM-5 · thinkingτ² standard agent · Qwen3.5-397B-A17B · thinking
構成
基盤モデルGLM-5Qwen3.5-397B-A17B
公開元のモデルIDまたは表記GLM-5 · thinkingQwen3.5-397B-A17B · thinking
結果
平均Pass¹81.01%87.91%
情報源
情報源を開く情報源を開く情報源を開く

構成

τ² standard agent · GLM-5 · thinking

基盤モデル
GLM-5
公開元のモデルIDまたは表記
GLM-5 · thinking

τ² standard agent · Qwen3.5-397B-A17B · thinking

基盤モデル
Qwen3.5-397B-A17B
公開元のモデルIDまたは表記
Qwen3.5-397B-A17B · thinking

結果

τ² standard agent · GLM-5 · thinking

平均Pass¹
81.01%

τ² standard agent · Qwen3.5-397B-A17B · thinking

平均Pass¹
87.91%

情報源

公開元のデータです。欠損値は不明のまま表示します。

導入前に実務で確認

公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。

  1. 1

    代表的な仕事を10〜20件選び、合格条件を決める。

  2. 2

    Agent、モデル、ツール、権限、予算を固定する。

  3. 3

    重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。

  4. 4

    失敗とデータ取扱いを確認してから導入を決める。

Agent製品一覧と評価