에이전트 구성 · GAIA

HAL Generalist Agent · GPT-5 Medium (August 2025)

모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.

정확도59.39%
성공 작업당 비용US$1.07
공개된 결과 범위공개되지 않음

01

구성

에이전트 시스템HAL Generalist Agent · GPT-5 Medium (August 2025)
기반 모델GPT-5 Medium (August 2025)
출처 모델 ID 또는 표기GPT-5 Medium (August 2025)
스캐폴드HAL Generalist Agent
스캐폴드 버전보고되지 않음
도구보고되지 않음
환경추론, 멀티모달, 브라우저와 도구가 필요한 범용 어시스턴트 작업
예산출처별 상이 · 통일된 단계 또는 토큰 한도 미공개

02

결과

정확도59.39%
부분 점수공개되지 않음
성공 작업당 비용US$1.07
공개된 전체 비용US$104.75
완료 시간 중앙값공개되지 않음
사람 개입공개되지 않음

03

운영

반복 실행 근거1회 실행
공개된 결과 범위공개되지 않음
안전 참고공개되지 않음
비교 그룹hal-gaia-public-validation-165
평가 날짜공개되지 않음
데이터 수집일

04

신뢰

근거전체 공개 실행 기록
출처Holistic Agent Leaderboard · GAIA
출처 스냅샷HAL 검증 스냅샷 · 공개 검증 세트 · 165문항 · 2026년 7월 30일
마지막 확인2026년 7월 30일
과제165 공개 검증 문항
근거 수준외부 주의
근거 참고

HAL이 공개 검증 행을 재현하고 스캐폴드, 모델, 점수, 비용, 실행 횟수와 추적 기록을 공개합니다. 통일된 도구 또는 단계 한도는 공개되지 않은 과거 스냅샷입니다.

감사 정보

이 결과가 증명하지 않는 것

표시된 시스템과 출처 조건에만 적용됩니다. 보편적 최고, 운영 신뢰성, 데이터 거버넌스 또는 다른 버전의 성능을 증명하지 않습니다.

같은 조건끼리 비교

같은 벤치마크 버전과 작업 범위의 구성만 비교할 수 있습니다.

출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.

도입 전 검증

공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

  1. 1

    대표 작업 10~20개와 명확한 통과 조건을 정합니다.

  2. 2

    Agent, 모델, 도구, 권한과 예산을 고정합니다.

  3. 3

    중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

  4. 4

    실패와 데이터 처리 위험을 검토한 뒤 도입합니다.

AI 에이전트 순위