المصادر التي تم فحصها:
دليل AI Agent والتقييمات
اعثر على منتجات Agent المتحقق منها، ثم قارن الإعدادات المنشورة ضمن نطاق المعيار نفسه فقط.
- الترتيب 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
- الترتيب 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
- الترتيب 3TRAE + Doubao-Seed-CodeByteDance78.8%
دليل منتجات Agent
حول إدراجات الدليل
أنظمة Agent متميزة لها صفحة منتج أو صفحة وثائق أو مستودع موثق تابع للطرف الأول. يتحقق الإدراج في الدليل من الهوية ونقطة دخول رسمية، لا من الأداء أو التوصية. لا يظهر في التصنيف أدناه إلا الدليل العام ضمن النطاق نفسه.
منتجات متحقق منها
66المصادر التي تم فحصها:
المصدر الرسمي
المصادر التي تم فحصها:
المصدر الرسمي
المصادر التي تم فحصها:
المصدر الرسمي
المصادر التي تم فحصها:
المصدر الرسمي
المصادر التي تم فحصها:
المصدر الرسمي
المصادر التي تم فحصها:
المصدر الرسمي
المصادر التي تم فحصها:
المصدر الرسمي
البرمجة
- الترتيب 1
- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- غير منشور
محلول79.2%مدرج لدى ناشر المعيارالمصدر - الترتيب 1
- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- غير منشور
محلول79.2%مدرج لدى ناشر المعيارالمصدر - الترتيب 3
TRAE + Doubao-Seed-Code
ByteDance- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- غير منشور
محلول78.8%مدرج لدى ناشر المعيارالمصدر - الترتيب 4
- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- غير منشور
محلول77.4%مدرج لدى ناشر المعيارالمصدر - الترتيب 5
Atlassian Rovo Dev (2025-09-02)
Atlassian- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- غير منشور
محلول76.8%مدرج لدى ناشر المعيارالمصدر - الترتيب 5
- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- غير منشور
محلول76.8%مدرج لدى ناشر المعيارالمصدر - الترتيب 5
- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- 376.95 US$
محلول76.8%مدرج لدى ناشر المعيارالمصدر - الترتيب 8
ACoder
ACoder- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- غير منشور
محلول76.4%مدرج لدى ناشر المعيارالمصدر - الترتيب 9
- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- 177.98 US$
محلول75.8%مدرج لدى ناشر المعيارالمصدر - الترتيب 9
- أدلة التشغيل المتكرر
- غير منشور
- تكلفة المعيار المبلغ عنها
- 36.64 US$
محلول75.8%مدرج لدى ناشر المعيارالمصدر
لمحة عن النتائج
- الترتيب 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
- الترتيب 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
- الترتيب 3TRAE + Doubao-Seed-Code78.8%
- الترتيب 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
- الترتيب 5Atlassian Rovo Dev (2025-09-02)76.8%
ملاحظة الأدلة
احتفظ بهذه النتائج كأدلة تاريخية. فقد أبلغ تدقيق أجرته OpenAI عام 2026 عن مشكلات في التصميم والتلوث ضمن SWE-bench Verified.
فتح التدقيقبيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.تحقّق قبل الاعتماد
تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.
- 1
اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.
- 2
ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.
- 3
نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.
- 4
راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.