에이전트 벤치마크

Terminal-Bench 2.1 에이전트 벤치마크

Terminal-Bench 2.1의 표시된 버전과 환경에 연결된 공개 행 17개를 유지합니다.

과제
89
공개 행
17
출처 데이터 날짜
ID 검토일
현재

근거 범위

terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard. terminal tasks. Harbor-managed terminal environments with fixed timeouts and resources. Fixed timeouts and resources · at least 5 trials per task.

OpenGPT의 근거 처리 방식

게시자의 지표, 과제 범위, 환경, 버전, 구성과 날짜를 보존하며 벤치마크 간 종합 점수를 만들지 않습니다.

비교 범위

  • 높은 결과는 표시된 벤치마크 버전과 조건에만 적용됩니다.
  • 에이전트 결과는 기반 모델 하나가 아닌 전체 시스템을 반영합니다.
  • 비용, 신뢰성, 안전성 또는 지연 시간 누락값은 추정하지 않습니다.
  • The Terminal-Bench team states that it ran and verified leaderboard submissions. Its 2.1 release notes document a revised task set and evaluation environment.

terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard

공개 17개 중 17개를 표시합니다. 모든 결과는 출처 벤치마크와 구성에 연결됩니다.

  1. Claude Code · Fable 5 · xhighAnthropic · Fable 5#1Accuracy: 83.8%Claude Code
  2. Codex · GPT-5.5 · xhighOpenAI · GPT-5.5#2Accuracy: 83.1%Codex
  3. Terminus 2 · Fable 5 · highTerminal-Bench · Fable 5#3Accuracy: 80.4%Terminus 2
  4. Cursor CLI · Grok 4.5 · highCursor · Grok 4.5#4Accuracy: 79.3%Cursor CLI
  5. Claude Code · Opus 4.8 · highAnthropic · Opus 4.8#5Accuracy: 78.9%Claude Code
  6. Codex · GPT-5.6 Terra · maxOpenAI · GPT-5.6 Terra#6Accuracy: 78.4%Codex
  7. Terminus 2 · GPT-5.5 · xhighTerminal-Bench · GPT-5.5#7Accuracy: 78.0%Terminus 2
  8. mini-SWE-agent · Muse Spark 1.1 · xhighPrinceton · Muse Spark 1.1#8Accuracy: 76.2%mini-SWE-agent
  9. Codex · GPT-5.6 Luna · maxOpenAI · GPT-5.6 Luna#9Accuracy: 75.7%Codex
  10. Claude Code · Sonnet 5 · highAnthropic · Sonnet 5#10Accuracy: 74.6%Claude Code
  11. Terminus 2 · Gemini 3 Pro · highTerminal-Bench · Gemini 3 Pro#11Accuracy: 73.9%Terminus 2
  12. Claude Code · Opus 4.7 · maxAnthropic · Opus 4.7#12Accuracy: 68.9%Claude Code
  13. Terminus 2 · Opus 4.7 · maxTerminal-Bench · Opus 4.7#13Accuracy: 66.1%Terminus 2
  14. Gemini CLI · Gemini 3 Pro · highGoogle · Gemini 3 Pro#14Accuracy: 65.8%Gemini CLI
  15. Gemini CLI · Gemini 3.1 Pro · highGoogle · Gemini 3.1 Pro#14Accuracy: 65.8%Gemini CLI
  16. Terminus 2 · Gemini 3.1 Pro · highTerminal-Bench · Gemini 3.1 Pro#16Accuracy: 65.6%Terminus 2
  17. Claude Code · GLM-5.1 · maxAnthropic · GLM-5.1#17Accuracy: 58.7%Claude Code