에이전트 구성 · τ³-Banking Knowledge
τ³ Banking AllTools · Grok 4.2 · high
모델, 스캐폴드, 도구, 권한, 예산과 환경을 합친 순위 대상입니다.
Pass¹18.04%
성공 작업당 비용공개되지 않음
공개된 결과 범위공개되지 않음
01
구성
에이전트 시스템τ³ Banking AllTools · Grok 4.2 · high
기반 모델Grok 4.2
출처 모델 ID 또는 표기Grok 4.2 · high
스캐폴드τ³ standard agent
스캐폴드 버전v1.0.1
도구AllTools: BM25, text-embedding-3-large retrieval, and sandboxed shell
환경BM25, 임베딩 검색과 샌드박스 명령줄 검색을 사용하는 표준 스캐폴드
예산작업당 4회 · 구성당 388개 궤적
02
결과
Pass¹18.04%
부분 점수공개되지 않음
성공 작업당 비용공개되지 않음
공개된 전체 비용보고되지 않음
완료 시간 중앙값공개되지 않음
사람 개입공개되지 않음
03
운영
반복 실행 근거4회 실행
공개된 결과 범위공개되지 않음
안전 참고공개되지 않음
비교 그룹tau3-banking-v1-0-1-alltools-gpt-5-2-low-seed-300-4-trials
평가 날짜
데이터 수집일
04
신뢰
근거벤치마크 공식 목록에 등재
출처Sierra Research · τ³-Banking
출처 스냅샷v1.0.1 · AllTools · GPT-5.2 low 사용자 시뮬레이터 · seed 300 · 4회 실행 · 2026년 7월 30일
마지막 확인2026년 7월 30일
과제97 은행 지식 작업
근거 수준게시자 관리
근거 참고
포함된 행은 v1.0.1, 은행 지식 97개 작업, AllTools, 사용자 시뮬레이터, seed와 4회 실행 조건이 같습니다. 미공개 비용은 알 수 없음으로 유지합니다.
감사 정보 ↗이 결과가 증명하지 않는 것
표시된 시스템과 출처 조건에만 적용됩니다. 보편적 최고, 운영 신뢰성, 데이터 거버넌스 또는 다른 버전의 성능을 증명하지 않습니다.
출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.
도입 전 검증
공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.
- 1
대표 작업 10~20개와 명확한 통과 조건을 정합니다.
- 2
Agent, 모델, 도구, 권한과 예산을 고정합니다.
- 3
중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.
- 4
실패와 데이터 처리 위험을 검토한 뒤 도입합니다.