解決率79.2%成功1件あたり費用未公開公開された結果範囲未公開
詳細 →共通のベンチマーク範囲 · SWE-bench Verified
同じベンチマークで比較
同じベンチマーク範囲の構成です。スキャフォールド、モデル版、日付、公開元の値をそのまま表示します。
値が高いことは、このベンチマーク条件での結果のみを示します。実運用品質や異なるベンチマークの総合点ではありません。
同じ条件で比較
判断概要
同じベンチマーク版とタスク範囲の構成だけを比較できます。
解決率77.4%成功1件あたり費用未公開公開された結果範囲未公開
詳細 →同一または全て未報告の17項目を非表示
| エージェントシステム | live-SWE-agent + Claude 4.5 Opus medium (20251101) | live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) |
|---|---|---|
| 構成 | ||
| 基盤モデル | Claude 4.5 Opus medium (20251101) | Gemini 3 Pro Preview (2025-11-18) |
| 公開元のモデルIDまたは表記 | claude-opus-4-5-20251101 | gemini-3-pro-preview |
| 結果 | ||
| 解決率 | 79.2% | 77.4% |
| 信頼性 | ||
| 評価日 | 2025年12月15日 | 2025年11月20日 |
| 情報源 | ||
| 情報源を開く | 情報源を開く ↗ | 情報源を開く ↗ |
構成
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- 基盤モデル
- Claude 4.5 Opus medium (20251101)
- 公開元のモデルIDまたは表記
- claude-opus-4-5-20251101
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- 基盤モデル
- Gemini 3 Pro Preview (2025-11-18)
- 公開元のモデルIDまたは表記
- gemini-3-pro-preview
結果
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- 解決率
- 79.2%
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- 解決率
- 77.4%
信頼性
live-SWE-agent + Claude 4.5 Opus medium (20251101)
- 評価日
- 2025年12月15日
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
- 評価日
- 2025年11月20日
情報源
公開元のデータです。欠損値は不明のまま表示します。
導入前に実務で確認
公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。
- 1
代表的な仕事を10〜20件選び、合格条件を決める。
- 2
Agent、モデル、ツール、権限、予算を固定する。
- 3
重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。
- 4
失敗とデータ取扱いを確認してから導入を決める。