Benchmarks d’Agents

Benchmark d’agents de Terminal-Bench 2.1

OpenGPT conserve 22 lignes publiées, associées à la version Terminal-Bench 2.1 exacte du benchmark et à l’environnement indiqués ci-dessous.

Tâches
89
Lignes publiées
22
Date des données sources
Identité examinée
À jour

Périmètre des preuves

terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard. terminal tasks. Harbor-managed terminal environments with fixed timeouts and resources. Fixed timeouts and resources · at least 5 trials per task.

How OpenGPT handles this evidence

OpenGPT conserve la métrique, le périmètre des tâches, l’environnement, la version, les champs de configuration et la date source de l’éditeur. Il ne crée aucun score Agent global couvrant plusieurs benchmarks.

Limites de la comparaison

  • Un meilleur résultat ne s’applique qu’à la version du benchmark et aux conditions affichées.
  • Les résultats des Agents reflètent le système complet, et non le seul modèle de base.
  • Les données manquantes sur les coûts, la fiabilité, la sécurité ou la latence restent non renseignées au lieu d’être déduites.
  • L’équipe Terminal-Bench déclare avoir exécuté et vérifié les soumissions au classement. Les notes de sa version 2.1 documentent une révision de l’ensemble de tâches et de l’environnement d’évaluation.

terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard

Affichage de 22 lignes publiées sur 22. Chaque résultat reste associé au benchmark et à la configuration de sa source.

  1. Codex · GPT-6 Astra · élevéOpenAI · GPT-6 Astra#1Accuracy: 87.4%Codex
  2. Codex · GPT-6 Astra · moyenOpenAI · GPT-6 Astra#2Accuracy: 87.0%Codex
  3. Codex · GPT-6 Astra · faibleOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
  4. Codex · GPT-6 Astra · maxOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
  5. Codex · GPT-6 Astra · xhighOpenAI · GPT-6 Astra#5Accuracy: 85.8%Codex
  6. Claude Code · Fable 5 · xhighAnthropic · Fable 5#6Accuracy: 83.8%Claude Code
  7. Codex · GPT-5.5 · xhighOpenAI · GPT-5.5#7Accuracy: 83.2%Codex
  8. Terminus 2 · Fable 5 · highTerminal-Bench · Fable 5#8Accuracy: 80.5%Terminus 2
  9. Cursor CLI · Grok 4.5 · highCursor · Grok 4.5#9Accuracy: 79.3%Cursor CLI
  10. Claude Code · Opus 4.8 · highAnthropic · Opus 4.8#10Accuracy: 78.9%Claude Code
  11. Codex · GPT-5.6 Terra · maxOpenAI · GPT-5.6 Terra#11Accuracy: 78.4%Codex
  12. Terminus 2 · GPT-5.5 · xhighTerminal-Bench · GPT-5.5#12Accuracy: 78.0%Terminus 2
  13. mini-SWE-agent · Muse Spark 1.1 · xhighPrinceton · Muse Spark 1.1#13Accuracy: 76.2%mini-SWE-agent
  14. Codex · GPT-5.6 Luna · maxOpenAI · GPT-5.6 Luna#14Accuracy: 75.7%Codex
  15. Claude Code · Sonnet 5 · highAnthropic · Sonnet 5#15Accuracy: 74.6%Claude Code
  16. Terminus 2 · Gemini 3 Pro · highTerminal-Bench · Gemini 3 Pro#16Accuracy: 73.9%Terminus 2
  17. Claude Code · Opus 4.7 · maxAnthropic · Opus 4.7#17Accuracy: 68.9%Claude Code
  18. Terminus 2 · Opus 4.7 · maxTerminal-Bench · Opus 4.7#18Accuracy: 66.1%Terminus 2
  19. Gemini CLI · Gemini 3 Pro · highGoogle · Gemini 3 Pro#19Accuracy: 65.8%Gemini CLI
  20. Gemini CLI · Gemini 3.1 Pro · highGoogle · Gemini 3.1 Pro#19Accuracy: 65.8%Gemini CLI
  21. Terminus 2 · Gemini 3.1 Pro · highTerminal-Bench · Gemini 3.1 Pro#21Accuracy: 65.6%Terminus 2
  22. Claude Code · GLM-5.1 · maxAnthropic · GLM-5.1#22Accuracy: 58.6%Claude Code