Benchmarks de Agents

Benchmark de agentes de Terminal-Bench 2.1

O OpenGPT mantém 22 linhas publicadas vinculadas à versão exata Terminal-Bench 2.1 do benchmark e ao ambiente exibido abaixo.

Tarefas
89
Linhas publicadas
22
Data dos dados da fonte
Identidade revisada
Atual

Escopo das evidências

terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard. terminal tasks. Harbor-managed terminal environments with fixed timeouts and resources. Fixed timeouts and resources · at least 5 trials per task.

How OpenGPT handles this evidence

O OpenGPT preserva a métrica, o escopo de tarefas, o ambiente, a versão, os campos de configuração e a data da fonte fornecidos pelo publicador. Ele não cria uma pontuação geral de Agentes que combine benchmarks.

Limites da comparação

  • Um resultado mais alto se aplica apenas à versão e às condições do benchmark exibidas.
  • Os resultados de Agents refletem o sistema completo, não apenas o modelo base.
  • Dados ausentes de custo, confiabilidade, segurança ou latência continuam sem ser informados, em vez de serem inferidos.
  • A equipe do Terminal-Bench afirma ter executado e verificado os envios do leaderboard. As notas da versão 2.1 documentam um conjunto revisado de tarefas e ambiente de avaliação.

terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard

Mostrando 22 de 22 linhas publicadas. Cada resultado permanece vinculado ao benchmark e à configuração da fonte.

  1. Codex · GPT-6 Astra · altoOpenAI · GPT-6 Astra#1Accuracy: 87.4%Codex
  2. Codex · GPT-6 Astra · médioOpenAI · GPT-6 Astra#2Accuracy: 87.0%Codex
  3. Codex · GPT-6 Astra · baixoOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
  4. Codex · GPT-6 Astra · maxOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
  5. Codex · GPT-6 Astra · xhighOpenAI · GPT-6 Astra#5Accuracy: 85.8%Codex
  6. Claude Code · Fable 5 · xhighAnthropic · Fable 5#6Accuracy: 83.8%Claude Code
  7. Codex · GPT-5.5 · xhighOpenAI · GPT-5.5#7Accuracy: 83.2%Codex
  8. Terminus 2 · Fable 5 · highTerminal-Bench · Fable 5#8Accuracy: 80.5%Terminus 2
  9. Cursor CLI · Grok 4.5 · highCursor · Grok 4.5#9Accuracy: 79.3%Cursor CLI
  10. Claude Code · Opus 4.8 · highAnthropic · Opus 4.8#10Accuracy: 78.9%Claude Code
  11. Codex · GPT-5.6 Terra · maxOpenAI · GPT-5.6 Terra#11Accuracy: 78.4%Codex
  12. Terminus 2 · GPT-5.5 · xhighTerminal-Bench · GPT-5.5#12Accuracy: 78.0%Terminus 2
  13. mini-SWE-agent · Muse Spark 1.1 · xhighPrinceton · Muse Spark 1.1#13Accuracy: 76.2%mini-SWE-agent
  14. Codex · GPT-5.6 Luna · maxOpenAI · GPT-5.6 Luna#14Accuracy: 75.7%Codex
  15. Claude Code · Sonnet 5 · highAnthropic · Sonnet 5#15Accuracy: 74.6%Claude Code
  16. Terminus 2 · Gemini 3 Pro · highTerminal-Bench · Gemini 3 Pro#16Accuracy: 73.9%Terminus 2
  17. Claude Code · Opus 4.7 · maxAnthropic · Opus 4.7#17Accuracy: 68.9%Claude Code
  18. Terminus 2 · Opus 4.7 · maxTerminal-Bench · Opus 4.7#18Accuracy: 66.1%Terminus 2
  19. Gemini CLI · Gemini 3 Pro · highGoogle · Gemini 3 Pro#19Accuracy: 65.8%Gemini CLI
  20. Gemini CLI · Gemini 3.1 Pro · highGoogle · Gemini 3.1 Pro#19Accuracy: 65.8%Gemini CLI
  21. Terminus 2 · Gemini 3.1 Pro · highTerminal-Bench · Gemini 3.1 Pro#21Accuracy: 65.6%Terminus 2
  22. Claude Code · GLM-5.1 · maxAnthropic · GLM-5.1#22Accuracy: 58.6%Claude Code