تكوين Agent · SWE-bench Verified

live-SWE-agent + Claude 4.5 Opus medium (20251101)

العنصر المرتّب: النموذج والبنية التوجيهية والأدوات والأذونات والميزانية والبيئة معًا.

محلول79.2%
التكلفة لكل مهمة ناجحةغير منشور
نطاق النتائج المنشورةغير منشور

01

الإعداد

نظام Agentlive-SWE-agent + Claude 4.5 Opus medium (20251101)
النموذج الأساسيClaude 4.5 Opus medium (20251101)
معرّف نموذج المصدر أو تسميتهclaude-opus-4-5-20251101
البنيةlive-SWE-agent
إصدار القالب الأوليغير مُبلّغ عنه
أدواتغير مُبلّغ عنه
البيئةبيئات مستودعات قابلة لإعادة الإنتاج قيّمها SWE-bench
الميزانيةتختلف الحدود باختلاف الإعداد المُرسل

02

النتيجة

محلول79.2%
درجة جزئيةغير منشور
التكلفة لكل مهمة ناجحةغير منشور
تكلفة المعيار المبلغ عنهاغير مُبلّغ عنه
الوسيط الزمني للإكمالغير منشور
التدخل البشريغير منشور

03

العملية

أدلة التشغيل المتكررغير منشور
نطاق النتائج المنشورةغير منشور
ملاحظة أمانغير منشور
مجموعة القابلية للمقارنةswe-bench-verified-full-500
تاريخ التقييم
البيانات الملتقطة

04

الثقة

الأدلةمدرج لدى ناشر المعيار
المصدرSWE-bench Verified
لقطة المصدرمتحقق منه · لوحة الصدارة الكاملة · 500 مهمة
تاريخ بيانات المصدر
استرجعها OpenGPT
آخر تغيير للترتيبلا يوجد سجل قابل للمقارنة بعد
آخر فحص
المهام500 مشكلات GitHub تم التحقق منها بشريًا
مستوى الأدلةتنبيه خارجي
ملاحظة الأدلة

احتفظ بهذه النتائج كأدلة تاريخية. فقد أبلغ تدقيق أجرته OpenAI عام 2026 عن مشكلات في التصميم والتلوث ضمن SWE-bench Verified.

فتح التدقيق

ما الذي لا تثبته هذه النتيجة

تنطبق هذه النتيجة على النظام المحدد وظروف المصدر المعروضة هنا فحسب. ولا تثبت وجود وكيل هو الأفضل عالميًا، أو موثوقية في بيئة الإنتاج، أو حوكمة للبيانات، أو أداءً على إصدار مختلف من المعيار المرجعي.

قارن المتماثل بالمتماثل

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات