공개 에이전트 평가

AI 에이전트 순위

66 Agent 시스템74 Agent 벤치마크 구성109 BFCL 도구 호출 모델 결과8 평가 범위

Agent 디렉터리

21

공식 제품 페이지, 문서 또는 저장소를 확인한 개별 Agent 시스템입니다.

등재는 공식 신원과 진입점 확인을 뜻하며 성능 평가나 추천이 아닙니다. 아래 순위에는 동일 범위의 공개 평가 근거만 표시합니다.

Augment AgentAugment Code
Agent 제품상용
출처 접근 가능

출처 확인일:

제품 상세
ClineCline Bot
오픈소스 Agent
출처 접근 가능

출처 확인일:

제품 상세
CodebuffCodebuffAI
오픈소스 Agent
출처 접근 가능

출처 확인일:

제품 상세
Cursor AgentAnysphere
Agent 제품상용
출처 접근 가능

출처 확인일:

제품 상세
DevinCognition
Agent 제품상용
출처 접근 가능

출처 확인일:

제품 상세
Factory DroidFactory
Agent 제품상용
출처 접근 가능

출처 확인일:

제품 상세

이 기기에 저장

코딩 에이전트

비교 가능한 구성 10개

Agent 제출
공개 결과SWE-bench VerifiedVerified · 전체 Agent 순위 · 500개 과제과거 근거출처 데이터 날짜출처가 날짜를 공개하지 않음OpenGPT 수집 시각순위 최종 변경일비교 이력 없음OpenGPT는 이 Agent 출처를 최소 주 1회 확인합니다.
출처 결과해결률
과제500 · 사람이 검증한 GitHub 이슈
근거 수준외부 주의
출처 열기
근거 참고

이 결과는 과거 근거로 봅니다. 2026년 OpenAI 감사는 SWE-bench Verified의 설계와 오염 문제를 지적했습니다.

감사 정보
1
Claude 4.5 Opus medium (20251101) · live-SWE-agent벤치마크 공식 목록에 등재
해결률79.2%
반복 실행 근거공개되지 않음
공개된 전체 비용공개되지 않음성공 작업당 비용: 공개되지 않음
상세
1
Claude 4.5 Opus · Sonar Foundation Agent벤치마크 공식 목록에 등재
해결률79.2%
반복 실행 근거공개되지 않음
공개된 전체 비용공개되지 않음성공 작업당 비용: 공개되지 않음
상세
3
Doubao-Seed-Code + Doubao-Seed-1.6 · TRAE벤치마크 공식 목록에 등재
해결률78.8%
반복 실행 근거공개되지 않음
공개된 전체 비용공개되지 않음성공 작업당 비용: 공개되지 않음
상세
4
Gemini 3 Pro Preview (2025-11-18) · live-SWE-agent벤치마크 공식 목록에 등재
해결률77.4%
반복 실행 근거공개되지 않음
공개된 전체 비용공개되지 않음성공 작업당 비용: 공개되지 않음
상세
5
Claude Sonnet 4 + GPT-5 · Atlassian Rovo Dev · 2025-09-02벤치마크 공식 목록에 등재
해결률76.8%
반복 실행 근거공개되지 않음
공개된 전체 비용공개되지 않음성공 작업당 비용: 공개되지 않음
상세
5
Claude 4 Sonnet · EPAM AI/Run Developer Agent · v20250719벤치마크 공식 목록에 등재
해결률76.8%
반복 실행 근거공개되지 않음
공개된 전체 비용공개되지 않음성공 작업당 비용: 공개되지 않음
상세
5
Claude 4.5 Opus (high reasoning) · mini-SWE-agent · 2.0.0벤치마크 공식 목록에 등재
해결률76.8%
반복 실행 근거공개되지 않음
공개된 전체 비용US$376.95성공 작업당 비용: 공개되지 않음
상세
8
ACoderACoder
Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro · ACoder벤치마크 공식 목록에 등재
해결률76.4%
반복 실행 근거공개되지 않음
공개된 전체 비용공개되지 않음성공 작업당 비용: 공개되지 않음
상세
9
Gemini 3 Flash (high reasoning) · mini-SWE-agent · 2.0.0벤치마크 공식 목록에 등재
해결률75.8%
반복 실행 근거공개되지 않음
공개된 전체 비용US$177.98성공 작업당 비용: 공개되지 않음
상세
9
MiniMax M2.5 (high reasoning) · mini-SWE-agent · 2.0.0벤치마크 공식 목록에 등재
해결률75.8%
반복 실행 근거공개되지 않음
공개된 전체 비용US$36.64성공 작업당 비용: 공개되지 않음
상세

이 기기에 저장

API 불필요

도입 위험 확인

공개 구성의 순서와 검토 위험을 조정하며 누락된 근거를 만들어 내지 않습니다.

이 조건의 시작 후보

비교 가능한 구성 3개

live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2% · 공개되지 않음 성공 작업당 비용

같은 벤치마크 구성에서 출처 결과가 높은 후보입니다.

상세 정보
Sonar Foundation Agent + Claude 4.5 Opus79.2% · 공개되지 않음 성공 작업당 비용

같은 벤치마크 구성에서 출처 결과가 높은 후보입니다.

상세 정보
TRAE + Doubao-Seed-Code78.8% · 공개되지 않음 성공 작업당 비용

같은 벤치마크 구성에서 출처 결과가 높은 후보입니다.

상세 정보

    출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.

    도입 전 검증

    공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

    1. 1

      대표 작업 10~20개와 명확한 통과 조건을 정합니다.

    2. 2

      Agent, 모델, 도구, 권한과 예산을 고정합니다.

    3. 3

      중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

    4. 4

      실패와 데이터 처리 위험을 검토한 뒤 도입합니다.