دليل AI Agent والتقييمات

اعثر على منتجات Agent المتحقق منها، ثم قارن الإعدادات المنشورة ضمن نطاق المعيار نفسه فقط.

أفضل 3 في التقييمSWE-bench Verified · محلول · 10 من التكوينات القابلة للمقارنة
  1. الترتيب 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. الترتيب 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. الترتيب 3TRAE + Doubao-Seed-CodeByteDance78.8%

البرمجة

اختر فئة مهمة
اللقطة والتغييراتلم تُخزن لقطة سابقة قابلة للمقارنة بعد.لقطة المصدر الحالية
  1. الترتيب 1
    النموذج الأساسي
    Claude 4.5 Opus medium (20251101)
    البنية
    live-SWE-agent
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    غير منشور
    محلول
    79.2%
  2. الترتيب 1
    النموذج الأساسي
    Claude 4.5 Opus
    البنية
    Sonar Foundation Agent
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    غير منشور
    محلول
    79.2%
  3. الترتيب 3
    النموذج الأساسي
    Doubao-Seed-Code + Doubao-Seed-1.6
    البنية
    TRAE
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    غير منشور
    محلول
    78.8%
  4. الترتيب 4
    النموذج الأساسي
    Gemini 3 Pro Preview (2025-11-18)
    البنية
    live-SWE-agent
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    غير منشور
    محلول
    77.4%
  5. الترتيب 5
    النموذج الأساسي
    Claude Sonnet 4 + GPT-5
    البنية
    Atlassian Rovo Dev
    إصدار القالب الأولي
    2025-09-02
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    غير منشور
    محلول
    76.8%
  6. الترتيب 5
    النموذج الأساسي
    Claude 4 Sonnet
    البنية
    EPAM AI/Run Developer Agent
    إصدار القالب الأولي
    v20250719
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    غير منشور
    محلول
    76.8%
  7. الترتيب 5
    النموذج الأساسي
    Claude 4.5 Opus (high reasoning)
    البنية
    mini-SWE-agent
    إصدار القالب الأولي
    2.0.0
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    ‏376.95 US$
    محلول
    76.8%
  8. الترتيب 8

    ACoder

    ACoder
    النموذج الأساسي
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    البنية
    ACoder
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    غير منشور
    محلول
    76.4%
  9. الترتيب 9
    النموذج الأساسي
    Gemini 3 Flash (high reasoning)
    البنية
    mini-SWE-agent
    إصدار القالب الأولي
    2.0.0
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    ‏177.98 US$
    محلول
    75.8%
  10. الترتيب 9
    النموذج الأساسي
    MiniMax M2.5 (high reasoning)
    البنية
    mini-SWE-agent
    إصدار القالب الأولي
    2.0.0
    أدلة التشغيل المتكرر
    غير منشور
    تكلفة المعيار المبلغ عنها
    ‏36.64 US$
    محلول
    75.8%
لمحة عن النتائج
لمحة عن النتائجSWE-bench Verified · نجاح المهمة
  1. الترتيب 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. الترتيب 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. الترتيب 3TRAE + Doubao-Seed-Code78.8%
  4. الترتيب 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. الترتيب 5Atlassian Rovo Dev (2025-09-02)76.8%
نتائج منشورةSWE-bench Verifiedمتحقق منه · لوحة الصدارة الكاملة · 500 مهمةأدلة تاريخية
تاريخ بيانات المصدراسترجعها OpenGPTآخر تغيير للترتيبلا يوجد سجل قابل للمقارنة بعدتفحص OpenGPT مصدر الوكيل هذا مرة أسبوعيًا على الأقل.
نتيجة المصدرمحلول
المهام500 · مشكلات GitHub تم التحقق منها بشريًا
مستوى الأدلةتنبيه خارجي
فتح المصدر
ملاحظة الأدلة

احتفظ بهذه النتائج كأدلة تاريخية. فقد أبلغ تدقيق أجرته OpenAI عام 2026 عن مشكلات في التصميم والتلوث ضمن SWE-bench Verified.

فتح التدقيق
بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.