公開済みエージェント評価

AIエージェントランキング

66 Agentシステム74 Agent評価構成109 BFCLツール呼び出しモデル結果8 評価範囲

Agentディレクトリ

21

公式製品ページ、ドキュメント、またはリポジトリを確認した個別のAgentシステムです。

掲載は公式な存在と入口の確認であり、性能評価や推奨ではありません。下のランキングには同一範囲の公開評価証拠だけを表示します。

Augment AgentAugment Code
Agent製品商用
情報源にアクセス可能

情報確認日:

製品詳細
ClineCline Bot
オープンソースAgent
情報源にアクセス可能

情報確認日:

製品詳細
CodebuffCodebuffAI
オープンソースAgent
情報源にアクセス可能

情報確認日:

製品詳細
Cursor AgentAnysphere
Agent製品商用
情報源にアクセス可能

情報確認日:

製品詳細
DevinCognition
Agent製品商用
情報源にアクセス可能

情報確認日:

製品詳細
Factory DroidFactory
Agent製品商用
情報源にアクセス可能

情報確認日:

製品詳細

この端末に保存

コーディング

比較可能な構成 10件

Agent を提出
公開結果ありSWE-bench VerifiedVerified · 全Agentランキング · 500課題過去の根拠情報源データ日情報源は日付を公開していませんOpenGPT取得日時順位の最終変更日比較履歴なしOpenGPTはこのAgent情報源を少なくとも週1回確認します。
公開元の結果解決率
課題数500 · 人手で検証されたGitHub課題
根拠レベル外部の注意情報あり
情報源を開く
根拠の注意

これらは過去の根拠として扱います。2026年のOpenAI監査はSWE-bench Verifiedの設計と汚染に懸念を示しました。

監査情報
1
Claude 4.5 Opus · Sonar Foundation Agentベンチマーク公開元に掲載
解決率79.2%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
詳細
3
Doubao-Seed-Code + Doubao-Seed-1.6 · TRAEベンチマーク公開元に掲載
解決率78.8%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
詳細
5
Claude Sonnet 4 + GPT-5 · Atlassian Rovo Dev · 2025-09-02ベンチマーク公開元に掲載
解決率76.8%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
詳細
5
Claude 4.5 Opus (high reasoning) · mini-SWE-agent · 2.0.0ベンチマーク公開元に掲載
解決率76.8%
反復実行の根拠未公開
公開された総費用$376.95成功1件あたり費用: 未公開
詳細
8
ACoderACoder
Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro · ACoderベンチマーク公開元に掲載
解決率76.4%
反復実行の根拠未公開
公開された総費用未公開成功1件あたり費用: 未公開
詳細
9
Gemini 3 Flash (high reasoning) · mini-SWE-agent · 2.0.0ベンチマーク公開元に掲載
解決率75.8%
反復実行の根拠未公開
公開された総費用$177.98成功1件あたり費用: 未公開
詳細
9
MiniMax M2.5 (high reasoning) · mini-SWE-agent · 2.0.0ベンチマーク公開元に掲載
解決率75.8%
反復実行の根拠未公開
公開された総費用$36.64成功1件あたり費用: 未公開
詳細

この端末に保存

API不要

導入リスクを確認

公開済み構成の順序と確認事項を調整します。未公開データを補完しません。

この条件の開始候補

比較可能な構成 3件

live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2% · 未公開 成功1件あたり費用

同じベンチマーク構成で公開元の値が高い候補です。

詳細
Sonar Foundation Agent + Claude 4.5 Opus79.2% · 未公開 成功1件あたり費用

同じベンチマーク構成で公開元の値が高い候補です。

詳細
TRAE + Doubao-Seed-Code78.8% · 未公開 成功1件あたり費用

同じベンチマーク構成で公開元の値が高い候補です。

詳細

    公開元のデータです。欠損値は不明のまま表示します。

    導入前に実務で確認

    公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。

    1. 1

      代表的な仕事を10〜20件選び、合格条件を決める。

    2. 2

      Agent、モデル、ツール、権限、予算を固定する。

    3. 3

      重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。

    4. 4

      失敗とデータ取扱いを確認してから導入を決める。