エージェント構成 · SWE-bench Verified
ACoder
モデル、スキャフォールド、ツール、権限、予算、環境を含むランキング対象です。
システム識別
エージェントシステムACoder
基盤モデルClaude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
公開元のモデルIDまたは表記claude-4-sonnet; claude-4.1-opus; gpt-5-0807-global; gemini-2.5-pro-06-17
スキャフォールドACoder
スキャフォールド版未報告
ツール未報告
比較グループswe-bench-verified-full-500
評価構成
情報源スナップショットSWE-bench Verified · Verified · 全Agentランキング · 500課題 · 2026年7月30日
課題数500 人手で検証されたGitHub課題
環境SWE-benchが評価する再現可能なリポジトリ環境
予算提出構成ごとに上限が異なります
評価日
データ取得日
解決率76.4%
部分スコア未報告
公開根拠
情報源を開く根拠ベンチマーク公開元に掲載
情報源SWE-bench Verified
費用未報告
費用の基準この構成には比較可能な費用が報告されていません
比較可能な費用が報告されていないため、低費用候補としては扱いません。
この結果で分からないこと
結果は表示されたシステムと条件にのみ適用されます。万能な最良エージェント、実運用品質、データ管理、別版での性能を証明しません。