AI 에이전트 디렉터리와 평가

검증된 Agent 제품을 찾고 같은 벤치마크 범위의 공개 구성만 비교하세요.

평가 상위 3개SWE-bench Verified · 해결률 · 비교 가능한 구성 10개
  1. 순위 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. 순위 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. 순위 3TRAE + Doubao-Seed-CodeByteDance78.8%

코딩

작업 범주 선택
스냅샷과 변화비교 가능한 이전 스냅샷이 아직 없습니다.현재 출처 스냅샷
  1. 순위 1
    기반 모델
    Claude 4.5 Opus medium (20251101)
    스캐폴드
    live-SWE-agent
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    공개되지 않음
    해결률
    79.2%
  2. 순위 1
    기반 모델
    Claude 4.5 Opus
    스캐폴드
    Sonar Foundation Agent
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    공개되지 않음
    해결률
    79.2%
  3. 순위 3
    기반 모델
    Doubao-Seed-Code + Doubao-Seed-1.6
    스캐폴드
    TRAE
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    공개되지 않음
    해결률
    78.8%
  4. 순위 4
    기반 모델
    Gemini 3 Pro Preview (2025-11-18)
    스캐폴드
    live-SWE-agent
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    공개되지 않음
    해결률
    77.4%
  5. 순위 5
    기반 모델
    Claude Sonnet 4 + GPT-5
    스캐폴드
    Atlassian Rovo Dev
    스캐폴드 버전
    2025-09-02
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    공개되지 않음
    해결률
    76.8%
  6. 순위 5
    기반 모델
    Claude 4 Sonnet
    스캐폴드
    EPAM AI/Run Developer Agent
    스캐폴드 버전
    v20250719
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    공개되지 않음
    해결률
    76.8%
  7. 순위 5
    기반 모델
    Claude 4.5 Opus (high reasoning)
    스캐폴드
    mini-SWE-agent
    스캐폴드 버전
    2.0.0
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    US$376.95
    해결률
    76.8%
  8. 순위 8

    ACoder

    ACoder
    기반 모델
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    스캐폴드
    ACoder
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    공개되지 않음
    해결률
    76.4%
  9. 순위 9
    기반 모델
    Gemini 3 Flash (high reasoning)
    스캐폴드
    mini-SWE-agent
    스캐폴드 버전
    2.0.0
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    US$177.98
    해결률
    75.8%
  10. 순위 9
    기반 모델
    MiniMax M2.5 (high reasoning)
    스캐폴드
    mini-SWE-agent
    스캐폴드 버전
    2.0.0
    반복 실행 근거
    공개되지 않음
    공개된 전체 비용
    US$36.64
    해결률
    75.8%
결과 한눈에 보기
결과 한눈에 보기SWE-bench Verified · 작업 성공
  1. 순위 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. 순위 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. 순위 3TRAE + Doubao-Seed-Code78.8%
  4. 순위 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. 순위 5Atlassian Rovo Dev (2025-09-02)76.8%
공개 결과SWE-bench VerifiedVerified · 전체 Agent 순위 · 500개 과제과거 근거
출처 데이터 날짜OpenGPT 수집 시각순위 최종 변경일비교 이력 없음OpenGPT는 이 Agent 출처를 최소 주 1회 확인합니다.
출처 결과해결률
과제500 · 사람이 검증한 GitHub 이슈
근거 수준외부 주의
출처 열기
근거 참고

이 결과는 과거 근거로 봅니다. 2026년 OpenAI 감사는 SWE-bench Verified의 설계와 오염 문제를 지적했습니다.

감사 정보
출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.도입 전 검증

공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

  1. 1

    대표 작업 10~20개와 명확한 통과 조건을 정합니다.

  2. 2

    Agent, 모델, 도구, 권한과 예산을 고정합니다.

  3. 3

    중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

  4. 4

    실패와 데이터 처리 위험을 검토한 뒤 도입합니다.