公開済みエージェント評価

AIエージェントランキング

同じ公開ベンチマーク範囲で、公開されたエージェント構成を比較します。元の尺度と公開元が示した構成情報をそのまま表示します。

異なるベンチマークを合成した総合点はありません。OpenGPTは公開元の結果を整理しており、再評価は行っていません。

エージェントシステム

モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。

基盤モデル

システムの一要素です。エージェント結果をモデル単体の能力とは見なしません。

API不要

調査するエージェント候補を探す

タスクと優先項目で候補を並べ、導入方法とデータ境界の回答から確認事項を示します。公開スナップショット内の構成だけを使用します。

タスク分類を選択

コーディング

SWE-bench Verified

Verified · 全Agentランキング · 500課題 · データ取得日 2026年7月30日

情報源を開く
公開元の結果解決率
課題数500 人手で検証されたGitHub課題
環境SWE-benchが評価する再現可能なリポジトリ環境
予算提出構成ごとに上限が異なります
1
live-SWE-agent + Claude 4.5 Opus medium (20251101)基盤モデル: Claude 4.5 Opus medium (20251101)公開元のモデルIDまたは表記: claude-opus-4-5-20251101ベンチマーク公開元に掲載
スキャフォールド: live-SWE-agentスキャフォールド版: 未報告ツール: 未報告Verified · 全Agentランキング · 500課題
解決率79.2%
費用未報告2025年12月15日
1
Sonar Foundation Agent + Claude 4.5 Opus基盤モデル: Claude 4.5 Opus公開元のモデルIDまたは表記: claude-opus-4-5ベンチマーク公開元に掲載
スキャフォールド: Sonar Foundation Agentスキャフォールド版: 未報告ツール: 未報告Verified · 全Agentランキング · 500課題
解決率79.2%
費用未報告2025年12月5日
3
TRAE + Doubao-Seed-Code基盤モデル: Doubao-Seed-Code + Doubao-Seed-1.6公開元のモデルIDまたは表記: Doubao-Seed-Code; Doubao-Seed-1.6ベンチマーク公開元に掲載
スキャフォールド: TRAEスキャフォールド版: 未報告ツール: 未報告Verified · 全Agentランキング · 500課題
解決率78.8%
費用未報告2025年9月28日
4
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)基盤モデル: Gemini 3 Pro Preview (2025-11-18)公開元のモデルIDまたは表記: gemini-3-pro-previewベンチマーク公開元に掲載
スキャフォールド: live-SWE-agentスキャフォールド版: 未報告ツール: 未報告Verified · 全Agentランキング · 500課題
解決率77.4%
費用未報告2025年11月20日
5
Atlassian Rovo Dev (2025-09-02)基盤モデル: Claude Sonnet 4 + GPT-5公開元のモデルIDまたは表記: claude-sonnet-4-20250514; gpt-5ベンチマーク公開元に掲載
スキャフォールド: Atlassian Rovo Devスキャフォールド版: 2025-09-02ツール: 未報告Verified · 全Agentランキング · 500課題
解決率76.8%
費用未報告2025年9月2日
5
EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet基盤モデル: Claude 4 Sonnet公開元のモデルIDまたは表記: claude-sonnet-4-20250514ベンチマーク公開元に掲載
スキャフォールド: EPAM AI/Run Developer Agentスキャフォールド版: v20250719ツール: 未報告Verified · 全Agentランキング · 500課題
解決率76.8%
費用未報告2025年8月4日
5
mini-SWE-agent + Claude 4.5 Opus (high reasoning)基盤モデル: Claude 4.5 Opus (high reasoning)公開元のモデルIDまたは表記: claude-4-5-opusベンチマーク公開元に掲載
スキャフォールド: mini-SWE-agentスキャフォールド版: 2.0.0ツール: Minimal repository shellVerified · 全Agentランキング · 500課題
解決率76.8%
費用$376.952026年2月17日
8
ACoder基盤モデル: Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro公開元のモデルIDまたは表記: claude-4-sonnet; claude-4.1-opus; gpt-5-0807-global; gemini-2.5-pro-06-17ベンチマーク公開元に掲載
スキャフォールド: ACoderスキャフォールド版: 未報告ツール: 未報告Verified · 全Agentランキング · 500課題
解決率76.4%
費用未報告2025年8月19日
9
mini-SWE-agent + Gemini 3 Flash (high reasoning)基盤モデル: Gemini 3 Flash (high reasoning)公開元のモデルIDまたは表記: gemini-3-flash-previewベンチマーク公開元に掲載
スキャフォールド: mini-SWE-agentスキャフォールド版: 2.0.0ツール: Minimal repository shellVerified · 全Agentランキング · 500課題
解決率75.8%
費用$177.982026年2月17日
9
mini-SWE-agent + MiniMax M2.5 (high reasoning)基盤モデル: MiniMax M2.5 (high reasoning)公開元のモデルIDまたは表記: minimax-m2.5ベンチマーク公開元に掲載
スキャフォールド: mini-SWE-agentスキャフォールド版: 2.0.0ツール: Minimal repository shellVerified · 全Agentランキング · 500課題
解決率75.8%
費用$36.642026年2月17日