معايير Agent

معيار وكلاء SWE-bench Verified

تُبقي OpenGPT عدد 10 من الصفوف المنشورة مرتبطًا بإصدار المعيار SWE-bench Verified الدقيق والبيئة الموضحة أدناه.

المهام
500
صفوف منشورة
10
تاريخ بيانات المصدر
تمت مراجعة الهوية
تاريخي

نطاق الأدلة

Verified · Top 10 published configurations · 500 tasks. human-validated GitHub issues. Reproducible repository environments evaluated بواسطة the upstream benchmark. Configuration-specific upstream limits.

How OpenGPT handles this evidence

تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.

حدود المقارنة

  • تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
  • تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
  • تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
  • احتفظ بهذه النتائج المنشورة كأدلة تاريخية، لا كمقياس عالمي حالي للقدرة على البرمجة. فقد أبلغ تدقيق أجرته OpenAI عام 2026 عن مشكلات جوهرية في التصميم والتلوث ضمن SWE-bench Verified.

Verified · Top 10 published configurations · 500 من المهام

عرض 10 من أصل 10 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.

  1. live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC · Claude 4.5 Opus medium (20251101)#1Resolved: 79.2%live-SWE-agent
  2. Sonar Foundation Agent + Claude 4.5 OpusSonar · Claude 4.5 Opus#1Resolved: 79.2%Sonar Foundation Agent
  3. TRAE + Doubao-Seed-CodeByteDance · Doubao-Seed-Code + Doubao-Seed-1.6#3Resolved: 78.8%TRAE
  4. live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)UIUC · Gemini 3 Pro Preview (2025-11-18)#4Resolved: 77.4%live-SWE-agent
  5. Atlassian Rovo Dev (2025-09-02)Atlassian · Claude Sonnet 4 + GPT-5#5Resolved: 76.8%Atlassian Rovo Dev
  6. EPAM AI/Run Developer Agent v20250719 + Claude 4 SonnetEPAM Systems · Claude 4 Sonnet#5Resolved: 76.8%EPAM AI/Run Developer Agent
  7. mini-SWE-agent + Claude 4.5 Opus (high reasoning)SWE-agent · Claude 4.5 Opus (high reasoning)#5Resolved: 76.8%mini-SWE-agent
  8. ACoderACoder · Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro#8Resolved: 76.4%ACoder
  9. mini-SWE-agent + Gemini 3 Flash (high reasoning)SWE-agent · Gemini 3 Flash (high reasoning)#9Resolved: 75.8%mini-SWE-agent
  10. mini-SWE-agent + MiniMax M2.5 (high reasoning)SWE-agent · MiniMax M2.5 (high reasoning)#9Resolved: 75.8%mini-SWE-agent