에이전트 구성 · SWE-bench Verified

mini-SWE-agent + MiniMax M2.5 (high reasoning)

모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.

시스템 식별

에이전트 시스템mini-SWE-agent + MiniMax M2.5 (high reasoning)
기반 모델MiniMax M2.5 (high reasoning)
출처 모델 ID 또는 표기minimax-m2.5
스캐폴드mini-SWE-agent
스캐폴드 버전2.0.0
도구Minimal repository shell
비교 그룹swe-bench-verified-full-500

평가 구성

출처 스냅샷SWE-bench Verified · Verified · 전체 Agent 순위 · 500개 과제 · 2026년 7월 30일
과제500 사람이 검증한 GitHub 이슈
환경SWE-bench가 평가하는 재현 가능한 저장소 환경
예산제출 구성에 따라 제한이 다릅니다
평가 날짜
데이터 수집일
해결률75.8%
부분 점수보고되지 않음

공개 근거

출처 열기
근거벤치마크 공식 목록에 등재
출처SWE-bench Verified
비용US$36.64
비용 기준출처가 보고한 전체 벤치마크 비용

이 결과가 증명하지 않는 것

표시된 시스템과 출처 조건에만 적용됩니다. 보편적 최고, 운영 신뢰성, 데이터 거버넌스 또는 다른 버전의 성능을 증명하지 않습니다.

AI 에이전트 순위