エージェント構成 · SWE-bench Verified

mini-SWE-agent + Gemini 3 Flash (high reasoning)

モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。

システム識別

エージェントシステムmini-SWE-agent + Gemini 3 Flash (high reasoning)
基盤モデルGemini 3 Flash (high reasoning)
公開元のモデルIDまたは表記gemini-3-flash-preview
スキャフォールドmini-SWE-agent
スキャフォールド版2.0.0
ツールMinimal repository shell
比較グループswe-bench-verified-full-500

評価構成

情報源スナップショットSWE-bench Verified · Verified · 全Agentランキング · 500課題 · 2026年7月30日
課題数500 人手で検証されたGitHub課題
環境SWE-benchが評価する再現可能なリポジトリ環境
予算提出構成ごとに上限が異なります
評価日
データ取得日
解決率75.8%
部分スコア未報告
根拠ベンチマーク公開元に掲載
情報源SWE-bench Verified
費用$177.98
費用の基準公開元が報告したベンチマーク全体の費用

この結果で分からないこと

結果は表示されたシステムと条件にのみ適用されます。万能な最良エージェント、実運用品質、データ管理、別版での性能を証明しません。

AIエージェントランキング