에이전트 구성 · OSWorld 2.0

OSWorld Agent · Claude Opus 4.8 · Max · Standard

모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.

완전 완료율18.52%
성공 작업당 비용공개되지 않음
공개된 결과 범위공개되지 않음

01

구성

에이전트 시스템OSWorld Agent · Claude Opus 4.8 · Max · Standard
기반 모델Claude Opus 4.8
출처 모델 ID 또는 표기Claude Opus 4.8
스캐폴드OSWorld 2.0 computer-use agent
스캐폴드 버전OSWorld 2.0
도구Standard computer-use tool
환경재현 가능한 가상 머신의 데스크톱 및 운영체제 작업
예산500단계

02

결과

완전 완료율18.52%
부분 점수49.33%
성공 작업당 비용공개되지 않음
공개된 전체 비용보고되지 않음
완료 시간 중앙값공개되지 않음
사람 개입공개되지 않음

03

운영

반복 실행 근거공개되지 않음
공개된 결과 범위공개되지 않음
안전 참고공개되지 않음
비교 그룹osworld-2-v2026-06-24-500
평가 날짜
데이터 수집일

04

신뢰

근거벤치마크 공식 목록에 등재
출처OSWorld 2.0
출처 스냅샷과제 버전 v2026.06.24 · 500단계 한도
출처 데이터 날짜
OpenGPT 수집 시각
순위 최종 변경일비교 이력 없음
마지막 확인
과제108 장시간 컴퓨터 작업 흐름
근거 수준게시자 관리
근거 참고

Agent, 모델, 도구 방식, 작업 버전, 단계 제한과 출처 지표를 보존합니다.

감사 정보

이 결과가 증명하지 않는 것

표시된 시스템과 출처 조건에만 적용됩니다. 보편적 최고, 운영 신뢰성, 데이터 거버넌스 또는 다른 버전의 성능을 증명하지 않습니다.

같은 조건끼리 비교

같은 벤치마크 버전과 작업 범위의 구성만 비교할 수 있습니다.

출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.

도입 전 검증

공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

  1. 1

    대표 작업 10~20개와 명확한 통과 조건을 정합니다.

  2. 2

    Agent, 모델, 도구, 권한과 예산을 고정합니다.

  3. 3

    중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

  4. 4

    실패와 데이터 처리 위험을 검토한 뒤 도입합니다.

Agent 디렉터리와 평가