Agent 評測
Terminal-Bench 2.1 Agent 評測
OpenGPT 將17筆公開記錄保留在下方所示的 Terminal-Bench 2.1 評測版本與環境內。
- 工作
- 89
- 公開記錄
- 17
- 來源資料日期
- 身分核驗日期
- 目前
資料範圍
terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard. terminal tasks. Harbor-managed terminal environments with fixed timeouts and resources. Fixed timeouts and resources · at least 5 trials per task.
OpenGPT 如何處理這些資料
OpenGPT 保留發布方的指標、工作範圍、環境、版本、設定欄位與資料日期,不產生跨評測 Agent 總分。
可比範圍
- 更高結果只適用於所展示的評測版本與條件。
- Agent 結果反映完整系統,而不是基礎模型單獨能力。
- 成本、穩定性、安全性或速度沒有公開時保持未報告,不進行推測。
- The Terminal-Bench team states that it ran and verified leaderboard submissions. Its 2.1 release notes document a revised task set and evaluation environment.
terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
展示17筆公開記錄中的17筆;每項結果都保留來源評測與設定。
- Claude Code · Fable 5 · xhighAnthropic · Fable 5#1Accuracy: 83.8%Claude Code
- Codex · GPT-5.5 · xhighOpenAI · GPT-5.5#2Accuracy: 83.1%Codex
- Terminus 2 · Fable 5 · highTerminal-Bench · Fable 5#3Accuracy: 80.4%Terminus 2
- Cursor CLI · Grok 4.5 · highCursor · Grok 4.5#4Accuracy: 79.3%Cursor CLI
- Claude Code · Opus 4.8 · highAnthropic · Opus 4.8#5Accuracy: 78.9%Claude Code
- Codex · GPT-5.6 Terra · maxOpenAI · GPT-5.6 Terra#6Accuracy: 78.4%Codex
- Terminus 2 · GPT-5.5 · xhighTerminal-Bench · GPT-5.5#7Accuracy: 78.0%Terminus 2
- mini-SWE-agent · Muse Spark 1.1 · xhighPrinceton · Muse Spark 1.1#8Accuracy: 76.2%mini-SWE-agent
- Codex · GPT-5.6 Luna · maxOpenAI · GPT-5.6 Luna#9Accuracy: 75.7%Codex
- Claude Code · Sonnet 5 · highAnthropic · Sonnet 5#10Accuracy: 74.6%Claude Code
- Terminus 2 · Gemini 3 Pro · highTerminal-Bench · Gemini 3 Pro#11Accuracy: 73.9%Terminus 2
- Claude Code · Opus 4.7 · maxAnthropic · Opus 4.7#12Accuracy: 68.9%Claude Code
- Terminus 2 · Opus 4.7 · maxTerminal-Bench · Opus 4.7#13Accuracy: 66.1%Terminus 2
- Gemini CLI · Gemini 3 Pro · highGoogle · Gemini 3 Pro#14Accuracy: 65.8%Gemini CLI
- Gemini CLI · Gemini 3.1 Pro · highGoogle · Gemini 3.1 Pro#14Accuracy: 65.8%Gemini CLI
- Terminus 2 · Gemini 3.1 Pro · highTerminal-Bench · Gemini 3.1 Pro#16Accuracy: 65.6%Terminus 2
- Claude Code · GLM-5.1 · maxAnthropic · GLM-5.1#17Accuracy: 58.7%Claude Code