에이전트 구성 · SWE-bench Verified

EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet

모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.

해결률76.8%
성공 작업당 비용공개되지 않음
공개된 결과 범위공개되지 않음

01

구성

에이전트 시스템EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet
기반 모델Claude 4 Sonnet
출처 모델 ID 또는 표기claude-sonnet-4-20250514
스캐폴드EPAM AI/Run Developer Agent
스캐폴드 버전v20250719
도구보고되지 않음
환경SWE-bench가 평가하는 재현 가능한 저장소 환경
예산제출 구성에 따라 제한이 다릅니다

02

결과

해결률76.8%
부분 점수공개되지 않음
성공 작업당 비용공개되지 않음
공개된 전체 비용보고되지 않음
완료 시간 중앙값공개되지 않음
사람 개입공개되지 않음

03

운영

반복 실행 근거공개되지 않음
공개된 결과 범위공개되지 않음
안전 참고공개되지 않음
비교 그룹swe-bench-verified-full-500
평가 날짜
데이터 수집일

04

신뢰

근거벤치마크 공식 목록에 등재
출처SWE-bench Verified
출처 스냅샷Verified · 전체 Agent 순위 · 500개 과제
출처 데이터 날짜
OpenGPT 수집 시각
순위 최종 변경일비교 이력 없음
마지막 확인
과제500 사람이 검증한 GitHub 이슈
근거 수준외부 주의
근거 참고

이 결과는 과거 근거로 봅니다. 2026년 OpenAI 감사는 SWE-bench Verified의 설계와 오염 문제를 지적했습니다.

감사 정보

이 결과가 증명하지 않는 것

표시된 시스템과 출처 조건에만 적용됩니다. 보편적 최고, 운영 신뢰성, 데이터 거버넌스 또는 다른 버전의 성능을 증명하지 않습니다.

출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.

도입 전 검증

공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

  1. 1

    대표 작업 10~20개와 명확한 통과 조건을 정합니다.

  2. 2

    Agent, 모델, 도구, 권한과 예산을 고정합니다.

  3. 3

    중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

  4. 4

    실패와 데이터 처리 위험을 검토한 뒤 도입합니다.

Agent 디렉터리와 평가