Benchmarks d’Agents
Benchmark d’agents de Terminal-Bench 2.1
OpenGPT conserve 22 lignes publiées, associées à la version Terminal-Bench 2.1 exacte du benchmark et à l’environnement indiqués ci-dessous.
- Tâches
- 89
- Lignes publiées
- 22
- Date des données sources
- Identité examinée
- À jour
Périmètre des preuves
terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard. terminal tasks. Harbor-managed terminal environments with fixed timeouts and resources. Fixed timeouts and resources · at least 5 trials per task.
How OpenGPT handles this evidence
OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.
Limites de la comparaison
- Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
- Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
- Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
- L’équipe Terminal-Bench déclare avoir exécuté et vérifié les soumissions au classement. Les notes de sa version 2.1 documentent une révision de l’ensemble de tâches et de l’environnement d’évaluation.
terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
Affichage de 22 lignes publiées sur 22. Chaque résultat reste associé au benchmark et à la configuration de sa source.
- Codex · GPT-6 Astra · élevéOpenAI · GPT-6 Astra#1Accuracy: 87.4%Codex
- Codex · GPT-6 Astra · moyenOpenAI · GPT-6 Astra#2Accuracy: 87.0%Codex
- Codex · GPT-6 Astra · faibleOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
- Codex · GPT-6 Astra · maxOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
- Codex · GPT-6 Astra · xhighOpenAI · GPT-6 Astra#5Accuracy: 85.8%Codex
- Claude Code · Fable 5 · xhighAnthropic · Fable 5#6Accuracy: 83.8%Claude Code
- Codex · GPT-5.5 · xhighOpenAI · GPT-5.5#7Accuracy: 83.2%Codex
- Terminus 2 · Fable 5 · highTerminal-Bench · Fable 5#8Accuracy: 80.5%Terminus 2
- Cursor CLI · Grok 4.5 · highCursor · Grok 4.5#9Accuracy: 79.3%Cursor CLI
- Claude Code · Opus 4.8 · highAnthropic · Opus 4.8#10Accuracy: 78.9%Claude Code
- Codex · GPT-5.6 Terra · maxOpenAI · GPT-5.6 Terra#11Accuracy: 78.4%Codex
- Terminus 2 · GPT-5.5 · xhighTerminal-Bench · GPT-5.5#12Accuracy: 78.0%Terminus 2
- mini-SWE-agent · Muse Spark 1.1 · xhighPrinceton · Muse Spark 1.1#13Accuracy: 76.2%mini-SWE-agent
- Codex · GPT-5.6 Luna · maxOpenAI · GPT-5.6 Luna#14Accuracy: 75.7%Codex
- Claude Code · Sonnet 5 · highAnthropic · Sonnet 5#15Accuracy: 74.6%Claude Code
- Terminus 2 · Gemini 3 Pro · highTerminal-Bench · Gemini 3 Pro#16Accuracy: 73.9%Terminus 2
- Claude Code · Opus 4.7 · maxAnthropic · Opus 4.7#17Accuracy: 68.9%Claude Code
- Terminus 2 · Opus 4.7 · maxTerminal-Bench · Opus 4.7#18Accuracy: 66.1%Terminus 2
- Gemini CLI · Gemini 3 Pro · highGoogle · Gemini 3 Pro#19Accuracy: 65.8%Gemini CLI
- Gemini CLI · Gemini 3.1 Pro · highGoogle · Gemini 3.1 Pro#19Accuracy: 65.8%Gemini CLI
- Terminus 2 · Gemini 3.1 Pro · highTerminal-Bench · Gemini 3.1 Pro#21Accuracy: 65.6%Terminus 2
- Claude Code · GLM-5.1 · maxAnthropic · GLM-5.1#22Accuracy: 58.6%Claude Code