معايير Agent
معيار وكلاء SWE-bench Verified
تُبقي OpenGPT عدد 10 من الصفوف المنشورة مرتبطًا بإصدار المعيار SWE-bench Verified الدقيق والبيئة الموضحة أدناه.
- المهام
- 500
- صفوف منشورة
- 10
- تاريخ بيانات المصدر
- تمت مراجعة الهوية
- تاريخي
نطاق الأدلة
Verified · Top 10 published configurations · 500 tasks. human-validated GitHub issues. Reproducible repository environments evaluated بواسطة the upstream benchmark. Configuration-specific upstream limits.
How OpenGPT handles this evidence
تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.
حدود المقارنة
- تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
- تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
- تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
- احتفظ بهذه النتائج المنشورة كأدلة تاريخية، لا كمقياس عالمي حالي للقدرة على البرمجة. فقد أبلغ تدقيق أجرته OpenAI عام 2026 عن مشكلات جوهرية في التصميم والتلوث ضمن SWE-bench Verified.
Verified · Top 10 published configurations · 500 من المهام
عرض 10 من أصل 10 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.
- live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC · Claude 4.5 Opus medium (20251101)#1Resolved: 79.2%live-SWE-agent
- Sonar Foundation Agent + Claude 4.5 OpusSonar · Claude 4.5 Opus#1Resolved: 79.2%Sonar Foundation Agent
- TRAE + Doubao-Seed-CodeByteDance · Doubao-Seed-Code + Doubao-Seed-1.6#3Resolved: 78.8%TRAE
- live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC · Gemini 3 Pro Preview (2025-11-18)#4Resolved: 77.4%live-SWE-agent
- Atlassian Rovo Dev (2025-09-02)Atlassian · Claude Sonnet 4 + GPT-5#5Resolved: 76.8%Atlassian Rovo Dev
- EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems · Claude 4 Sonnet#5Resolved: 76.8%EPAM AI/Run Developer Agent
- mini-SWE-agent + Claude 4.5 Opus (high reasoning)SWE-agent · Claude 4.5 Opus (high reasoning)#5Resolved: 76.8%mini-SWE-agent
- ACoderACoder · Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro#8Resolved: 76.4%ACoder
- mini-SWE-agent + Gemini 3 Flash (high reasoning)SWE-agent · Gemini 3 Flash (high reasoning)#9Resolved: 75.8%mini-SWE-agent
- mini-SWE-agent + MiniMax M2.5 (high reasoning)SWE-agent · MiniMax M2.5 (high reasoning)#9Resolved: 75.8%mini-SWE-agent