에이전트 구성 · τ²-bench Core

τ² standard agent · GPT-5.2 · no reasoning

모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.

평균 Pass¹61.58%
성공 작업당 비용공개되지 않음
공개된 결과 범위공개되지 않음

01

구성

에이전트 시스템τ² standard agent · GPT-5.2 · no reasoning
기반 모델GPT-5.2
출처 모델 ID 또는 표기GPT-5.2 · no reasoning
스캐폴드τ² standard agent
스캐폴드 버전v1.0.1
도구Standard retail, airline, and telecom domain tools
환경표준 Agent와 도메인 도구, 공통 GPT-5.2 low 추론 사용자 시뮬레이터
예산작업당 4회 · 구성당 1,112개 궤적

02

결과

평균 Pass¹61.58%
부분 점수공개되지 않음
성공 작업당 비용공개되지 않음
공개된 전체 비용보고되지 않음
완료 시간 중앙값공개되지 않음
사람 개입공개되지 않음

03

운영

반복 실행 근거4회 실행
공개된 결과 범위공개되지 않음
안전 참고공개되지 않음
비교 그룹tau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
평가 날짜
데이터 수집일

04

신뢰

근거벤치마크 공식 목록에 등재
출처Sierra Research · τ²-bench
출처 스냅샷v1.0.1 · 표준 Agent · GPT-5.2 low 사용자 시뮬레이터 · 4회 실행 · 2026년 7월 30일
마지막 확인2026년 7월 30일
과제278 소매·항공·통신 기본 작업
근거 수준게시자 관리
근거 참고

v1.0.1, 표준 스캐폴드와 도구, 같은 사용자 시뮬레이터, 기본 작업 분할과 4회 실행이 일치하는 게시자 제출 8개 행만 포함합니다. 다른 τ-bench 행은 이 범위 밖입니다.

감사 정보

이 결과가 증명하지 않는 것

표시된 시스템과 출처 조건에만 적용됩니다. 보편적 최고, 운영 신뢰성, 데이터 거버넌스 또는 다른 버전의 성능을 증명하지 않습니다.

같은 조건끼리 비교

같은 벤치마크 버전과 작업 범위의 구성만 비교할 수 있습니다.

출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.

도입 전 검증

공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.

  1. 1

    대표 작업 10~20개와 명확한 통과 조건을 정합니다.

  2. 2

    Agent, 모델, 도구, 권한과 예산을 고정합니다.

  3. 3

    중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.

  4. 4

    실패와 데이터 처리 위험을 검토한 뒤 도입합니다.

AI 에이전트 순위