모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.
공개 에이전트 평가
AI 에이전트 순위
같은 공개 벤치마크 범위에서 공개된 에이전트 구성을 비교합니다. 원본 척도와 출처가 공개한 구성 정보를 그대로 표시합니다.
서로 다른 벤치마크를 합친 종합 점수는 없습니다. OpenGPT는 공개 결과를 정리하며 재평가하지 않았습니다.
시스템의 한 구성 요소이며 에이전트 결과를 모델 단독 성능으로 보지 않습니다.
API 불필요
검토할 에이전트 구성 찾기
작업과 우선순위로 후보를 정렬하고, 배포 및 데이터 경계 답변으로 검토할 위험을 표시합니다. 공개 스냅샷의 구성만 사용합니다.
작업 범주 선택
코딩 에이전트
SWE-bench Verified
Verified · 전체 Agent 순위 · 500개 과제 · 데이터 수집일 2026년 7월 30일
출처 결과해결률
과제500 사람이 검증한 GitHub 이슈
환경SWE-bench가 평가하는 재현 가능한 저장소 환경
예산제출 구성에 따라 제한이 다릅니다
1
live-SWE-agent + Claude 4.5 Opus medium (20251101)기반 모델: Claude 4.5 Opus medium (20251101)출처 모델 ID 또는 표기: claude-opus-4-5-20251101벤치마크 공식 목록에 등재
스캐폴드: live-SWE-agent스캐폴드 버전: 보고되지 않음도구: 보고되지 않음Verified · 전체 Agent 순위 · 500개 과제
해결률79.2%
비용보고되지 않음2025년 12월 15일
1
Sonar Foundation Agent + Claude 4.5 Opus기반 모델: Claude 4.5 Opus출처 모델 ID 또는 표기: claude-opus-4-5벤치마크 공식 목록에 등재
스캐폴드: Sonar Foundation Agent스캐폴드 버전: 보고되지 않음도구: 보고되지 않음Verified · 전체 Agent 순위 · 500개 과제
해결률79.2%
비용보고되지 않음2025년 12월 5일
3
TRAE + Doubao-Seed-Code기반 모델: Doubao-Seed-Code + Doubao-Seed-1.6출처 모델 ID 또는 표기: Doubao-Seed-Code; Doubao-Seed-1.6벤치마크 공식 목록에 등재
스캐폴드: TRAE스캐폴드 버전: 보고되지 않음도구: 보고되지 않음Verified · 전체 Agent 순위 · 500개 과제
해결률78.8%
비용보고되지 않음2025년 9월 28일
4
live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)기반 모델: Gemini 3 Pro Preview (2025-11-18)출처 모델 ID 또는 표기: gemini-3-pro-preview벤치마크 공식 목록에 등재
스캐폴드: live-SWE-agent스캐폴드 버전: 보고되지 않음도구: 보고되지 않음Verified · 전체 Agent 순위 · 500개 과제
해결률77.4%
비용보고되지 않음2025년 11월 20일
5
Atlassian Rovo Dev (2025-09-02)기반 모델: Claude Sonnet 4 + GPT-5출처 모델 ID 또는 표기: claude-sonnet-4-20250514; gpt-5벤치마크 공식 목록에 등재
스캐폴드: Atlassian Rovo Dev스캐폴드 버전: 2025-09-02도구: 보고되지 않음Verified · 전체 Agent 순위 · 500개 과제
해결률76.8%
비용보고되지 않음2025년 9월 2일
5
EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet기반 모델: Claude 4 Sonnet출처 모델 ID 또는 표기: claude-sonnet-4-20250514벤치마크 공식 목록에 등재
스캐폴드: EPAM AI/Run Developer Agent스캐폴드 버전: v20250719도구: 보고되지 않음Verified · 전체 Agent 순위 · 500개 과제
해결률76.8%
비용보고되지 않음2025년 8월 4일
5
mini-SWE-agent + Claude 4.5 Opus (high reasoning)기반 모델: Claude 4.5 Opus (high reasoning)출처 모델 ID 또는 표기: claude-4-5-opus벤치마크 공식 목록에 등재
스캐폴드: mini-SWE-agent스캐폴드 버전: 2.0.0도구: Minimal repository shellVerified · 전체 Agent 순위 · 500개 과제
해결률76.8%
비용US$376.952026년 2월 17일
8
ACoder기반 모델: Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro출처 모델 ID 또는 표기: claude-4-sonnet; claude-4.1-opus; gpt-5-0807-global; gemini-2.5-pro-06-17벤치마크 공식 목록에 등재
스캐폴드: ACoder스캐폴드 버전: 보고되지 않음도구: 보고되지 않음Verified · 전체 Agent 순위 · 500개 과제
해결률76.4%
비용보고되지 않음2025년 8월 19일
9
mini-SWE-agent + Gemini 3 Flash (high reasoning)기반 모델: Gemini 3 Flash (high reasoning)출처 모델 ID 또는 표기: gemini-3-flash-preview벤치마크 공식 목록에 등재
스캐폴드: mini-SWE-agent스캐폴드 버전: 2.0.0도구: Minimal repository shellVerified · 전체 Agent 순위 · 500개 과제
해결률75.8%
비용US$177.982026년 2월 17일
9
mini-SWE-agent + MiniMax M2.5 (high reasoning)기반 모델: MiniMax M2.5 (high reasoning)출처 모델 ID 또는 표기: minimax-m2.5벤치마크 공식 목록에 등재
스캐폴드: mini-SWE-agent스캐폴드 버전: 2.0.0도구: Minimal repository shellVerified · 전체 Agent 순위 · 500개 과제
해결률75.8%
비용US$36.642026년 2월 17일