AIエージェントの製品一覧と評価

確認済みのAgent製品を探し、同じベンチマーク範囲の公開構成だけを比較できます。

評価トップ3SWE-bench Verified · 解決率 · 比較可能な構成 10件
  1. 順位 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. 順位 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. 順位 3TRAE + Doubao-Seed-CodeByteDance78.8%

コーディング

タスク分類を選択
スナップショットと変化比較可能な過去スナップショットはまだありません。現在の情報源スナップショット
  1. 順位 1
    基盤モデル
    Claude 4.5 Opus medium (20251101)
    スキャフォールド
    live-SWE-agent
    反復実行の根拠
    未公開
    公開された総費用
    未公開
    解決率
    79.2%
  2. 順位 1
    基盤モデル
    Claude 4.5 Opus
    スキャフォールド
    Sonar Foundation Agent
    反復実行の根拠
    未公開
    公開された総費用
    未公開
    解決率
    79.2%
  3. 順位 3
    基盤モデル
    Doubao-Seed-Code + Doubao-Seed-1.6
    スキャフォールド
    TRAE
    反復実行の根拠
    未公開
    公開された総費用
    未公開
    解決率
    78.8%
  4. 順位 4
    基盤モデル
    Gemini 3 Pro Preview (2025-11-18)
    スキャフォールド
    live-SWE-agent
    反復実行の根拠
    未公開
    公開された総費用
    未公開
    解決率
    77.4%
  5. 順位 5
    基盤モデル
    Claude Sonnet 4 + GPT-5
    スキャフォールド
    Atlassian Rovo Dev
    スキャフォールド版
    2025-09-02
    反復実行の根拠
    未公開
    公開された総費用
    未公開
    解決率
    76.8%
  6. 順位 5
    基盤モデル
    Claude 4 Sonnet
    スキャフォールド
    EPAM AI/Run Developer Agent
    スキャフォールド版
    v20250719
    反復実行の根拠
    未公開
    公開された総費用
    未公開
    解決率
    76.8%
  7. 順位 5
    基盤モデル
    Claude 4.5 Opus (high reasoning)
    スキャフォールド
    mini-SWE-agent
    スキャフォールド版
    2.0.0
    反復実行の根拠
    未公開
    公開された総費用
    $376.95
    解決率
    76.8%
  8. 順位 8

    ACoder

    ACoder
    基盤モデル
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    スキャフォールド
    ACoder
    反復実行の根拠
    未公開
    公開された総費用
    未公開
    解決率
    76.4%
  9. 順位 9
    基盤モデル
    Gemini 3 Flash (high reasoning)
    スキャフォールド
    mini-SWE-agent
    スキャフォールド版
    2.0.0
    反復実行の根拠
    未公開
    公開された総費用
    $177.98
    解決率
    75.8%
  10. 順位 9
    基盤モデル
    MiniMax M2.5 (high reasoning)
    スキャフォールド
    mini-SWE-agent
    スキャフォールド版
    2.0.0
    反復実行の根拠
    未公開
    公開された総費用
    $36.64
    解決率
    75.8%
結果をひと目で確認
結果をひと目で確認SWE-bench Verified · タスク成功
  1. 順位 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. 順位 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. 順位 3TRAE + Doubao-Seed-Code78.8%
  4. 順位 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. 順位 5Atlassian Rovo Dev (2025-09-02)76.8%
公開結果ありSWE-bench VerifiedVerified · 全Agentランキング · 500課題過去の根拠
情報源データ日OpenGPT取得日時順位の最終変更日比較履歴なしOpenGPTはこのAgent情報源を少なくとも週1回確認します。
公開元の結果解決率
課題数500 · 人手で検証されたGitHub課題
根拠レベル外部の注意情報あり
情報源を開く
根拠の注意

これらは過去の根拠として扱います。2026年のOpenAI監査はSWE-bench Verifiedの設計と汚染に懸念を示しました。

監査情報
公開元のデータです。欠損値は不明のまま表示します。導入前に実務で確認

公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。

  1. 1

    代表的な仕事を10〜20件選び、合格条件を決める。

  2. 2

    Agent、モデル、ツール、権限、予算を固定する。

  3. 3

    重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。

  4. 4

    失敗とデータ取扱いを確認してから導入を決める。