Benchmarks de Agents
Benchmark de agentes de SWE-bench Verified
O OpenGPT mantém 10 linhas publicadas vinculadas à versão exata SWE-bench Verified do benchmark e ao ambiente exibido abaixo.
- Tarefas
- 500
- Linhas publicadas
- 10
- Data dos dados da fonte
- Identidade revisada
- Histórico
Escopo das evidências
Verified · Top 10 published configurations · 500 tasks. human-validated GitHub issues. Reproducible repository environments evaluated por the upstream benchmark. Configuration-specific upstream limits.
How OpenGPT handles this evidence
O OpenGPT preserva a métrica, o escopo de tarefas, o ambiente, a versão, os campos de configuração e a data da fonte fornecidos pelo publicador. Ele não cria uma pontuação geral de Agentes que combine benchmarks.
Limites da comparação
- Um resultado mais alto se aplica apenas à versão e às condições do benchmark exibidas.
- Os resultados de Agents refletem o sistema completo, não apenas o modelo base.
- Dados ausentes de custo, confiabilidade, segurança ou latência continuam sem ser informados, em vez de serem inferidos.
- Mantenha esses resultados publicados como evidências históricas, não como uma medição universal atual da capacidade de programação. Uma auditoria da OpenAI de 2026 relatou problemas fundamentais de concepção e contaminação no SWE-bench Verified.
Verified · Top 10 published configurations · 500 tarefas
Mostrando 10 de 10 linhas publicadas. Cada resultado permanece vinculado ao benchmark e à configuração da fonte.
- live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC · Claude 4.5 Opus medium (20251101)#1Resolved: 79.2%live-SWE-agent
- Sonar Foundation Agent + Claude 4.5 OpusSonar · Claude 4.5 Opus#1Resolved: 79.2%Sonar Foundation Agent
- TRAE + Doubao-Seed-CodeByteDance · Doubao-Seed-Code + Doubao-Seed-1.6#3Resolved: 78.8%TRAE
- live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC · Gemini 3 Pro Preview (2025-11-18)#4Resolved: 77.4%live-SWE-agent
- Atlassian Rovo Dev (2025-09-02)Atlassian · Claude Sonnet 4 + GPT-5#5Resolved: 76.8%Atlassian Rovo Dev
- EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems · Claude 4 Sonnet#5Resolved: 76.8%EPAM AI/Run Developer Agent
- mini-SWE-agent + Claude 4.5 Opus (high reasoning)SWE-agent · Claude 4.5 Opus (high reasoning)#5Resolved: 76.8%mini-SWE-agent
- ACoderACoder · Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro#8Resolved: 76.4%ACoder
- mini-SWE-agent + Gemini 3 Flash (high reasoning)SWE-agent · Gemini 3 Flash (high reasoning)#9Resolved: 75.8%mini-SWE-agent
- mini-SWE-agent + MiniMax M2.5 (high reasoning)SWE-agent · MiniMax M2.5 (high reasoning)#9Resolved: 75.8%mini-SWE-agent