共通のベンチマーク範囲 · OSWorld 2.0

同じベンチマークで比較

同じベンチマーク範囲の構成です。スキャフォールド、モデル版、日付、公開元の値をそのまま表示します。

値が高いことは、このベンチマーク条件での結果のみを示します。実運用品質や異なるベンチマークの総合点ではありません。

同じ条件で比較

判断概要

同じベンチマーク版とタスク範囲の構成だけを比較できます。

公開元のデータです。欠損値は不明のまま表示します。
OpenAIOSWorld Agent · GPT-5.5 · Xhigh · Batch tool
完全達成率13.0%成功1件あたり費用未公開公開された結果範囲未公開
詳細
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
完全達成率20.6%成功1件あたり費用未公開公開された結果範囲未公開
詳細
同一または全て未報告の15項目を非表示
エージェントシステムOSWorld Agent · GPT-5.5 · Xhigh · Batch toolOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
構成
基盤モデルGPT-5.5Claude Opus 4.8
公開元のモデルIDまたは表記GPT-5.5Claude Opus 4.8
ツールBatch computer-use toolBatched computer-use tool
結果
完全達成率13.0%20.6%
部分スコア49.5%54.8%
公開された総費用$2,750未公開
情報源
情報源を開く情報源を開く情報源を開く

構成

OSWorld Agent · GPT-5.5 · Xhigh · Batch tool

基盤モデル
GPT-5.5
公開元のモデルIDまたは表記
GPT-5.5
ツール
Batch computer-use tool

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

基盤モデル
Claude Opus 4.8
公開元のモデルIDまたは表記
Claude Opus 4.8
ツール
Batched computer-use tool

結果

OSWorld Agent · GPT-5.5 · Xhigh · Batch tool

完全達成率
13.0%
部分スコア
49.5%
公開された総費用
$2,750

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

完全達成率
20.6%
部分スコア
54.8%
公開された総費用
未公開

情報源

公開元のデータです。欠損値は不明のまま表示します。

導入前に実務で確認

公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。

  1. 1

    代表的な仕事を10〜20件選び、合格条件を決める。

  2. 2

    Agent、モデル、ツール、権限、予算を固定する。

  3. 3

    重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。

  4. 4

    失敗とデータ取扱いを確認してから導入を決める。

Agent製品一覧と評価