エージェント構成 · OSWorld 2.0
OSWorld Agent · GPT-5.5 · Xhigh · Batch tool
モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。
完全達成率13.0%
成功1件あたり費用未公開
公開された結果範囲未公開
01
構成
エージェントシステムOSWorld Agent · GPT-5.5 · Xhigh · Batch tool
基盤モデルGPT-5.5
公開元のモデルIDまたは表記GPT-5.5
スキャフォールドOSWorld 2.0 computer-use agent
スキャフォールド版OSWorld 2.0
ツールBatch computer-use tool
環境再現可能な仮想環境でのデスクトップとOS操作
予算500ステップ
02
結果
完全達成率13.0%
部分スコア49.5%
成功1件あたり費用未公開
公開された総費用$2,750
完了時間の中央値未公開
人の介入未公開
03
運用
反復実行の根拠未公開
公開された結果範囲未公開
安全上の注意未公開
比較グループosworld-2-v2026-06-24-500
評価日
データ取得日
04
信頼性
根拠ベンチマーク公開元に掲載
情報源OSWorld 2.0
情報源スナップショットタスク版 v2026.06.24 · 500ステップ上限
情報源データ日情報源は日付を公開していません
OpenGPT取得日時
順位の最終変更日比較履歴なし
最終確認
課題数108 長時間のPC操作ワークフロー
根拠レベル公開元が管理
根拠の注意
Agent、モデル、ツール方式、課題版、ステップ上限、公開元の指標を保持しています。
監査情報 ↗この結果で分からないこと
結果は表示されたシステムと条件にのみ適用されます。万能な最良エージェント、実運用品質、データ管理、別版での性能を証明しません。
公開元のデータです。欠損値は不明のまま表示します。
導入前に実務で確認
公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。
- 1
代表的な仕事を10〜20件選び、合格条件を決める。
- 2
Agent、モデル、ツール、権限、予算を固定する。
- 3
重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。
- 4
失敗とデータ取扱いを確認してから導入を決める。