평균 Pass¹81.01%성공 작업당 비용공개되지 않음공개된 결과 범위공개되지 않음
상세 정보 →공통 벤치마크 범위 · τ²-bench Core
같은 벤치마크 비교
같은 벤치마크 범위의 구성입니다. 스캐폴드, 모델 버전, 날짜와 출처 값을 그대로 표시합니다.
높은 값은 이 벤치마크 조건의 결과일 뿐 운영 준비도나 교차 벤치마크 점수가 아닙니다.
같은 조건끼리 비교
판단 개요
같은 벤치마크 버전과 작업 범위의 구성만 비교할 수 있습니다.
평균 Pass¹87.91%성공 작업당 비용공개되지 않음공개된 결과 범위공개되지 않음
상세 정보 →동일하거나 모두 미보고인 필드 18개 숨김
| 에이전트 시스템 | τ² standard agent · GLM-5 · thinking | τ² standard agent · Qwen3.5-397B-A17B · thinking |
|---|---|---|
| 구성 | ||
| 기반 모델 | GLM-5 | Qwen3.5-397B-A17B |
| 출처 모델 ID 또는 표기 | GLM-5 · thinking | Qwen3.5-397B-A17B · thinking |
| 결과 | ||
| 평균 Pass¹ | 81.01% | 87.91% |
| 출처 | ||
| 출처 열기 | 출처 열기 ↗ | 출처 열기 ↗ |
구성
τ² standard agent · GLM-5 · thinking
- 기반 모델
- GLM-5
- 출처 모델 ID 또는 표기
- GLM-5 · thinking
τ² standard agent · Qwen3.5-397B-A17B · thinking
- 기반 모델
- Qwen3.5-397B-A17B
- 출처 모델 ID 또는 표기
- Qwen3.5-397B-A17B · thinking
결과
τ² standard agent · GLM-5 · thinking
- 평균 Pass¹
- 81.01%
τ² standard agent · Qwen3.5-397B-A17B · thinking
- 평균 Pass¹
- 87.91%
출처
출처 공개 데이터이며 누락값은 알 수 없음으로 유지합니다.
도입 전 검증
공개 순위는 후보 목록입니다. 작은 비공개 시험으로 실제 적합성을 확인하세요.
- 1
대표 작업 10~20개와 명확한 통과 조건을 정합니다.
- 2
Agent, 모델, 도구, 권한과 예산을 고정합니다.
- 3
중요 작업은 반복 실행하고 성공, 비용, 시간, 개입을 기록합니다.
- 4
실패와 데이터 처리 위험을 검토한 뒤 도입합니다.