エージェント構成 · SWE-bench Verified

Atlassian Rovo Dev (2025-09-02)

モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。

解決率76.8%
成功1件あたり費用未公開
公開された結果範囲未公開

01

構成

エージェントシステムAtlassian Rovo Dev (2025-09-02)
基盤モデルClaude Sonnet 4 + GPT-5
公開元のモデルIDまたは表記claude-sonnet-4-20250514; gpt-5
スキャフォールドAtlassian Rovo Dev
スキャフォールド版2025-09-02
ツール未報告
環境SWE-benchが評価する再現可能なリポジトリ環境
予算提出構成ごとに上限が異なります

02

結果

解決率76.8%
部分スコア未公開
成功1件あたり費用未公開
公開された総費用未報告
完了時間の中央値未公開
人の介入未公開

03

運用

反復実行の根拠未公開
公開された結果範囲未公開
安全上の注意未公開
比較グループswe-bench-verified-full-500
評価日
データ取得日

04

信頼性

根拠ベンチマーク公開元に掲載
情報源SWE-bench Verified
情報源スナップショットVerified · 全Agentランキング · 500課題
情報源データ日
OpenGPT取得日時
順位の最終変更日比較履歴なし
最終確認
課題数500 人手で検証されたGitHub課題
根拠レベル外部の注意情報あり
根拠の注意

これらは過去の根拠として扱います。2026年のOpenAI監査はSWE-bench Verifiedの設計と汚染に懸念を示しました。

監査情報

この結果で分からないこと

結果は表示されたシステムと条件にのみ適用されます。万能な最良エージェント、実運用品質、データ管理、別版での性能を証明しません。

公開元のデータです。欠損値は不明のまま表示します。

導入前に実務で確認

公開順位は候補選びの出発点です。小規模な非公開試験で適合性を確認します。

  1. 1

    代表的な仕事を10〜20件選び、合格条件を決める。

  2. 2

    Agent、モデル、ツール、権限、予算を固定する。

  3. 3

    重要な仕事は複数回実行し、成功、費用、時間、介入を記録する。

  4. 4

    失敗とデータ取扱いを確認してから導入を決める。

Agent製品一覧と評価