公開済みエージェント評価
AIエージェントランキング
66 Agentシステム74 Agent評価構成109 BFCLツール呼び出しモデル結果8 評価範囲
掲載は公式な存在と入口の確認であり、性能評価や推奨ではありません。下のランキングには同一範囲の公開評価証拠だけを表示します。
Atlassian Rovo DevAtlassian
Agent製品商用
情報確認日:
Augment AgentAugment Code
Agent製品商用
情報源にアクセス可能
情報確認日:
Claude CodeAnthropic
Agent製品商用
情報確認日:
ClineCline Bot
オープンソースAgent
情報源にアクセス可能
情報確認日:
CodebuffCodebuffAI
オープンソースAgent
情報源にアクセス可能
情報確認日:
Cursor AgentAnysphere
Agent製品商用
情報源にアクセス可能
情報確認日:
DevinCognition
Agent製品商用
情報源にアクセス可能
情報確認日:
Factory DroidFactory
Agent製品商用
情報源にアクセス可能
情報確認日:
この端末に保存
公開結果ありSWE-bench VerifiedVerified · 全Agentランキング · 500課題過去の根拠情報源データ日情報源は日付を公開していませんOpenGPT取得日時順位の最終変更日比較履歴なしOpenGPTはこのAgent情報源を少なくとも週1回確認します。
公開元の結果解決率
課題数500 · 人手で検証されたGitHub課題
根拠レベル外部の注意情報あり
情報源を開く↗根拠の注意
これらは過去の根拠として扱います。2026年のOpenAI監査はSWE-bench Verifiedの設計と汚染に懸念を示しました。
監査情報↗1
Claude 4.5 Opus medium (20251101) · live-SWE-agentベンチマーク公開元に掲載 解決率79.2%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
1
Claude 4.5 Opus · Sonar Foundation Agentベンチマーク公開元に掲載 解決率79.2%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
3
Doubao-Seed-Code + Doubao-Seed-1.6 · TRAEベンチマーク公開元に掲載 解決率78.8%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
4
Gemini 3 Pro Preview (2025-11-18) · live-SWE-agentベンチマーク公開元に掲載 解決率77.4%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
5
Claude Sonnet 4 + GPT-5 · Atlassian Rovo Dev · 2025-09-02ベンチマーク公開元に掲載 解決率76.8%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
5
Claude 4 Sonnet · EPAM AI/Run Developer Agent · v20250719ベンチマーク公開元に掲載 解決率76.8%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
5
Claude 4.5 Opus (high reasoning) · mini-SWE-agent · 2.0.0ベンチマーク公開元に掲載 解決率76.8%
反復実行の根拠未公開
公開された総費用$376.95成功1件あたり費用: 未公開
8
Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro · ACoderベンチマーク公開元に掲載 解決率76.4%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
9
Gemini 3 Flash (high reasoning) · mini-SWE-agent · 2.0.0ベンチマーク公開元に掲載 解決率75.8%
反復実行の根拠未公開
公開された総費用$177.98成功1件あたり費用: 未公開
9
MiniMax M2.5 (high reasoning) · mini-SWE-agent · 2.0.0ベンチマーク公開元に掲載 解決率75.8%
反復実行の根拠未公開
公開された総費用$36.64成功1件あたり費用: 未公開
この端末に保存
API不要
導入リスクを確認
公開済み構成の順序と確認事項を調整します。未公開データを補完しません。
この条件の開始候補
比較可能な構成 3件
live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2% · 未公開 成功1件あたり費用同じベンチマーク構成で公開元の値が高い候補です。
詳細 →Sonar Foundation Agent + Claude 4.5 Opus79.2% · 未公開 成功1件あたり費用同じベンチマーク構成で公開元の値が高い候補です。
詳細 →TRAE + Doubao-Seed-Code78.8% · 未公開 成功1件あたり費用同じベンチマーク構成で公開元の値が高い候補です。
詳細 → 公開元のデータです。欠損値は不明のまま表示します。
導入前に実務で確認
公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。
- 1
代表的な仕事を10〜20件選び、合格条件を決める。
- 2
Agent、モデル、ツール、権限、予算を固定する。
- 3
重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。
- 4
失敗とデータ取扱いを確認してから導入を決める。