Benchmark degli Agent
Benchmark degli agenti di Terminal-Bench 2.1
OpenGPT mantiene 22 righe pubblicate associate alla versione esatta del benchmark Terminal-Bench 2.1 e all’ambiente mostrato sotto.
- Attività
- 89
- Righe pubblicate
- 22
- Data dei dati della fonte
- Identità esaminata
- Attuale
Ambito delle evidenze
terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard. terminal tasks. Harbor-managed terminal environments with fixed timeouts and resources. Fixed timeouts and resources · at least 5 trials per task.
How OpenGPT handles this evidence
OpenGPT conserva la metrica, l’ambito delle attività, l’ambiente, la versione, i campi della configurazione e la data della fonte indicati dal publisher. Non crea un punteggio complessivo degli Agent tra benchmark diversi.
Limiti del confronto
- Un risultato più elevato si applica solo alla versione del benchmark e alle condizioni visualizzate.
- I risultati degli Agent riflettono il sistema completo, non soltanto il modello di base.
- I dati mancanti su costi, affidabilità, sicurezza o latenza restano non indicati anziché essere dedotti.
- Il team di Terminal-Bench dichiara di aver eseguito e verificato gli invii della classifica. Le note della release 2.1 documentano un insieme di attività e un ambiente di valutazione modificati.
terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
Visualizzate 22 di 22 righe pubblicate. Ogni risultato rimane associato al benchmark e alla configurazione della fonte.
- Codex · GPT-6 Astra · altoOpenAI · GPT-6 Astra#1Accuracy: 87.4%Codex
- Codex · GPT-6 Astra · medioOpenAI · GPT-6 Astra#2Accuracy: 87.0%Codex
- Codex · GPT-6 Astra · bassoOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
- Codex · GPT-6 Astra · maxOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
- Codex · GPT-6 Astra · xhighOpenAI · GPT-6 Astra#5Accuracy: 85.8%Codex
- Claude Code · Fable 5 · xhighAnthropic · Fable 5#6Accuracy: 83.8%Claude Code
- Codex · GPT-5.5 · xhighOpenAI · GPT-5.5#7Accuracy: 83.2%Codex
- Terminus 2 · Fable 5 · highTerminal-Bench · Fable 5#8Accuracy: 80.5%Terminus 2
- Cursor CLI · Grok 4.5 · highCursor · Grok 4.5#9Accuracy: 79.3%Cursor CLI
- Claude Code · Opus 4.8 · highAnthropic · Opus 4.8#10Accuracy: 78.9%Claude Code
- Codex · GPT-5.6 Terra · maxOpenAI · GPT-5.6 Terra#11Accuracy: 78.4%Codex
- Terminus 2 · GPT-5.5 · xhighTerminal-Bench · GPT-5.5#12Accuracy: 78.0%Terminus 2
- mini-SWE-agent · Muse Spark 1.1 · xhighPrinceton · Muse Spark 1.1#13Accuracy: 76.2%mini-SWE-agent
- Codex · GPT-5.6 Luna · maxOpenAI · GPT-5.6 Luna#14Accuracy: 75.7%Codex
- Claude Code · Sonnet 5 · highAnthropic · Sonnet 5#15Accuracy: 74.6%Claude Code
- Terminus 2 · Gemini 3 Pro · highTerminal-Bench · Gemini 3 Pro#16Accuracy: 73.9%Terminus 2
- Claude Code · Opus 4.7 · maxAnthropic · Opus 4.7#17Accuracy: 68.9%Claude Code
- Terminus 2 · Opus 4.7 · maxTerminal-Bench · Opus 4.7#18Accuracy: 66.1%Terminus 2
- Gemini CLI · Gemini 3 Pro · highGoogle · Gemini 3 Pro#19Accuracy: 65.8%Gemini CLI
- Gemini CLI · Gemini 3.1 Pro · highGoogle · Gemini 3.1 Pro#19Accuracy: 65.8%Gemini CLI
- Terminus 2 · Gemini 3.1 Pro · highTerminal-Bench · Gemini 3.1 Pro#21Accuracy: 65.6%Terminus 2
- Claude Code · GLM-5.1 · maxAnthropic · GLM-5.1#22Accuracy: 58.6%Claude Code