에이전트 구성 · Terminal-Bench 2.1

Terminus 2 · Fable 5 · high

모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.

작업 정확도80.4%
성공 작업당 비용공개되지 않음
공개된 결과 범위±1.2%

01

구성

에이전트 시스템Terminus 2 · Fable 5 · high
기반 모델Fable 5
출처 모델 ID 또는 표기Fable 5
스캐폴드Terminus 2
스캐폴드 버전보고되지 않음
도구Terminal shell
환경Harbor 관리 터미널 환경
예산고정 제한 · 작업당 5회 이상

02

결과

작업 정확도80.4%
부분 점수공개되지 않음
성공 작업당 비용공개되지 않음
공개된 전체 비용US$438.64
완료 시간 중앙값공개되지 않음
사람 개입공개되지 않음

03

운영

반복 실행 근거공개되지 않음
공개된 결과 범위±1.2%
안전 참고공개되지 않음
비교 그룹terminal-bench-2-1-main
평가 날짜
데이터 수집일

04

신뢰

근거벤치마크 공식 목록에 등재
출처Terminal-Bench 2.1
출처 스냅샷Terminal-Bench 2.1 · 게시자 검증 순위 · 2026년 7월 30일
마지막 확인2026년 7월 30일
과제89 터미널 작업
근거 수준게시자 관리
근거 참고

Terminal-Bench 팀은 제출을 직접 실행하고 검증했다고 설명합니다. 2.1은 작업과 평가 환경을 개정했습니다.

감사 정보

이 결과가 증명하지 않는 것

표시된 시스템과 출처 조건에만 적용됩니다. 보편적 최고, 운영 신뢰성, 데이터 거버넌스 또는 다른 버전의 성능을 증명하지 않습니다.

같은 조건끼리 비교

같은 벤치마크 버전과 작업 범위의 구성만 비교할 수 있습니다.

출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.

도입 전 검증

공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

  1. 1

    대표 작업 10~20개와 명확한 통과 조건을 정합니다.

  2. 2

    Agent, 모델, 도구, 권한과 예산을 고정합니다.

  3. 3

    중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

  4. 4

    실패와 데이터 처리 위험을 검토한 뒤 도입합니다.

AI 에이전트 순위