에이전트 벤치마크
τ³-Banking Knowledge 에이전트 벤치마크
τ³-Banking Knowledge의 표시된 버전과 환경에 연결된 공개 행 21개를 유지합니다.
- 과제
- 97
- 공개 행
- 21
- 출처 데이터 날짜
- ID 검토일
- 현재
근거 범위
v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials. banking knowledge tasks. Standard scaffold with BM25, embedding retrieval, and sandboxed command-line search. 4 trials per task · 388 trajectories per configuration.
OpenGPT의 근거 처리 방식
게시자의 지표, 과제 범위, 환경, 버전, 구성과 날짜를 보존하며 벤치마크 간 종합 점수를 만들지 않습니다.
비교 범위
- 높은 결과는 표시된 벤치마크 버전과 조건에만 적용됩니다.
- 에이전트 결과는 기반 모델 하나가 아닌 전체 시스템을 반영합니다.
- 비용, 신뢰성, 안전성 또는 지연 시간 누락값은 추정하지 않습니다.
- The included rows use the same benchmark version, 97-task Banking Knowledge split, AllTools configuration, user simulator, seed, and four-trial protocol. Missing costs remain unreported. This snapshot includes all 21 compatible publisher submissions available at the pinned revision.
v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials
공개 21개 중 21개를 표시합니다. 모든 결과는 출처 벤치마크와 구성에 연결됩니다.
- τ³ Banking AllTools · Qwen 3.8 Max · xhighQwen · Qwen 3.8 Max#1Pass¹: 55.15%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 5 · maxAnthropic · Claude Opus 5#2Pass¹: 48.71%τ³ standard agent
- τ³ Banking AllTools · Grok 4.5 · highxAI · Grok 4.5#3Pass¹: 47.94%τ³ standard agent
- τ³ Banking AllTools · GPT-5.6-sol · xhighOpenAI · GPT-5.6-sol#4Pass¹: 46.91%τ³ standard agent
- τ³ Banking AllTools · GPT-5.5 · xhighOpenAI · GPT-5.5#5Pass¹: 44.59%τ³ standard agent
- τ³ Banking AllTools · Muse Spark 1.1 · xhighMeta · Muse Spark 1.1#6Pass¹: 40.46%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.7 · maxAnthropic · Claude Opus 4.7#7Pass¹: 40.21%τ³ standard agent
- τ³ Banking AllTools · Claude Fable 5 · maxAnthropic · Claude Fable 5#8Pass¹: 39.69%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.8 · maxAnthropic · Claude Opus 4.8#9Pass¹: 39.69%τ³ standard agent
- τ³ Banking AllTools · GPT-5.4 · xhighOpenAI · GPT-5.4#10Pass¹: 39.43%τ³ standard agent
- τ³ Banking AllTools · GLM-5.2 · xhighZ.ai · GLM-5.2#11Pass¹: 37.11%τ³ standard agent
- τ³ Banking AllTools · Kimi K3 · maxMoonshot AI · Kimi K3#12Pass¹: 37.11%τ³ standard agent
- τ³ Banking AllTools · GPT-5.2 · highOpenAI · GPT-5.2#13Pass¹: 32.22%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.6 · maxAnthropic · Claude Opus 4.6#14Pass¹: 27.32%τ³ standard agent
- τ³ Banking AllTools · Gemini 3.1 Pro Preview · highGoogle · Gemini 3.1 Pro Preview#15Pass¹: 26.03%τ³ standard agent
- τ³ Banking AllTools · Inkling · maxThinking Machines Lab · Inkling#16Pass¹: 25.00%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.5 · highAnthropic · Claude Opus 4.5#17Pass¹: 24.74%τ³ standard agent
- τ³ Banking AllTools · Grok 4.2 · highxAI · Grok 4.2#18Pass¹: 18.04%τ³ standard agent
- τ³ Banking AllTools · Grok 4 fast · highxAI · Grok 4 fast#19Pass¹: 15.72%τ³ standard agent
- τ³ Banking AllTools · Gemini 2.5 Pro · highGoogle · Gemini 2.5 Pro#20Pass¹: 13.66%τ³ standard agent
- τ³ Banking AllTools · Grok 4.1 fast · highxAI · Grok 4.1 fast#21Pass¹: 13.14%τ³ standard agent