共通のベンチマーク範囲 · SWE-bench Verified

同じベンチマークで比較

同じベンチマーク範囲の構成です。スキャフォールド、モデル版、日付、公開元の値をそのまま表示します。

値が高いことは、このベンチマーク条件での結果のみを示します。実運用品質や異なるベンチマークの総合点ではありません。

同じ条件で比較

判断概要

同じベンチマーク版とタスク範囲の構成だけを比較できます。

公開元のデータです。欠損値は不明のまま表示します。
UIUClive-SWE-agent + Claude 4.5 Opus medium (20251101)
解決率79.2%成功1件あたり費用未公開公開された結果範囲未公開
詳細
UIUClive-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
解決率77.4%成功1件あたり費用未公開公開された結果範囲未公開
詳細
同一または全て未報告の17項目を非表示
エージェントシステムlive-SWE-agent + Claude 4.5 Opus medium (20251101)live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
構成
基盤モデルClaude 4.5 Opus medium (20251101)Gemini 3 Pro Preview (2025-11-18)
公開元のモデルIDまたは表記claude-opus-4-5-20251101gemini-3-pro-preview
結果
解決率79.2%77.4%
信頼性
評価日2025年12月15日2025年11月20日
情報源
情報源を開く情報源を開く情報源を開く

構成

live-SWE-agent + Claude 4.5 Opus medium (20251101)

基盤モデル
Claude 4.5 Opus medium (20251101)
公開元のモデルIDまたは表記
claude-opus-4-5-20251101

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

基盤モデル
Gemini 3 Pro Preview (2025-11-18)
公開元のモデルIDまたは表記
gemini-3-pro-preview

結果

live-SWE-agent + Claude 4.5 Opus medium (20251101)

解決率
79.2%

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

解決率
77.4%

信頼性

live-SWE-agent + Claude 4.5 Opus medium (20251101)

評価日
2025年12月15日

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

評価日
2025年11月20日

情報源

公開元のデータです。欠損値は不明のまま表示します。

導入前に実務で確認

公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。

  1. 1

    代表的な仕事を10〜20件選び、合格条件を決める。

  2. 2

    Agent、モデル、ツール、権限、予算を固定する。

  3. 3

    重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。

  4. 4

    失敗とデータ取扱いを確認してから導入を決める。

Agent製品一覧と評価