공통 벤치마크 범위 · OSWorld 2.0

같은 벤치마크 비교

같은 벤치마크 범위의 구성입니다. 스캐폴드, 모델 버전, 날짜와 출처 값을 그대로 표시합니다.

높은 값은 이 벤치마크 조건의 결과일 뿐 운영 준비도나 교차 벤치마크 점수가 아닙니다.

같은 조건끼리 비교

판단 개요

같은 벤치마크 버전과 작업 범위의 구성만 비교할 수 있습니다.

출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.
AnthropicOSWorld Agent · Claude Sonnet 4.6 · Medium · Standard
완전 완료율9.3%성공 작업당 비용공개되지 않음공개된 결과 범위공개되지 않음
상세 정보
AnthropicOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
완전 완료율20.6%성공 작업당 비용공개되지 않음공개된 결과 범위공개되지 않음
상세 정보
동일하거나 모두 미보고인 필드 15개 숨김
에이전트 시스템OSWorld Agent · Claude Sonnet 4.6 · Medium · StandardOSWorld Agent · Claude Opus 4.8 · Max · Batched tool
구성
기반 모델Claude Sonnet 4.6Claude Opus 4.8
출처 모델 ID 또는 표기Claude Sonnet 4.6Claude Opus 4.8
도구Standard computer-use toolBatched computer-use tool
결과
완전 완료율9.3%20.6%
부분 점수33.9%54.8%
공개된 전체 비용US$1,550공개되지 않음
출처
출처 열기출처 열기출처 열기

구성

OSWorld Agent · Claude Sonnet 4.6 · Medium · Standard

기반 모델
Claude Sonnet 4.6
출처 모델 ID 또는 표기
Claude Sonnet 4.6
도구
Standard computer-use tool

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

기반 모델
Claude Opus 4.8
출처 모델 ID 또는 표기
Claude Opus 4.8
도구
Batched computer-use tool

결과

OSWorld Agent · Claude Sonnet 4.6 · Medium · Standard

완전 완료율
9.3%
부분 점수
33.9%
공개된 전체 비용
US$1,550

OSWorld Agent · Claude Opus 4.8 · Max · Batched tool

완전 완료율
20.6%
부분 점수
54.8%
공개된 전체 비용
공개되지 않음

출처

출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.

도입 전 검증

공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

  1. 1

    대표 작업 10~20개와 명확한 통과 조건을 정합니다.

  2. 2

    Agent, 모델, 도구, 권한과 예산을 고정합니다.

  3. 3

    중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

  4. 4

    실패와 데이터 처리 위험을 검토한 뒤 도입합니다.

Agent 디렉터리와 평가