تكوين Agent · SWE-bench Verified

mini-SWE-agent + MiniMax M2.5 (high reasoning)

العنصر المرتّب: النموذج والبنية التوجيهية والأدوات والأذونات والميزانية والبيئة معًا.

محلول75.8%
التكلفة لكل مهمة ناجحةغير منشور
نطاق النتائج المنشورةغير منشور

01

الإعداد

نظام Agentmini-SWE-agent + MiniMax M2.5 (high reasoning)
النموذج الأساسيMiniMax M2.5 (high reasoning)
معرّف نموذج المصدر أو تسميتهminimax-m2.5
البنيةmini-SWE-agent
إصدار القالب الأولي2.0.0
أدواتMinimal repository shell
البيئةبيئات مستودعات قابلة لإعادة الإنتاج قيّمها SWE-bench
الميزانيةتختلف الحدود باختلاف الإعداد المُرسل

02

النتيجة

محلول75.8%
درجة جزئيةغير منشور
التكلفة لكل مهمة ناجحةغير منشور
تكلفة المعيار المبلغ عنها‏36.64 US$
الوسيط الزمني للإكمالغير منشور
التدخل البشريغير منشور

03

العملية

أدلة التشغيل المتكررغير منشور
نطاق النتائج المنشورةغير منشور
ملاحظة أمانغير منشور
مجموعة القابلية للمقارنةswe-bench-verified-full-500
تاريخ التقييم
البيانات الملتقطة

04

الثقة

الأدلةمدرج لدى ناشر المعيار
المصدرSWE-bench Verified
لقطة المصدرمتحقق منه · لوحة الصدارة الكاملة · 500 مهمة
تاريخ بيانات المصدر
استرجعها OpenGPT
آخر تغيير للترتيبلا يوجد سجل قابل للمقارنة بعد
آخر فحص
المهام500 مشكلات GitHub تم التحقق منها بشريًا
مستوى الأدلةتنبيه خارجي
ملاحظة الأدلة

احتفظ بهذه النتائج كأدلة تاريخية. فقد أبلغ تدقيق أجرته OpenAI عام 2026 عن مشكلات في التصميم والتلوث ضمن SWE-bench Verified.

فتح التدقيق

ما الذي لا تثبته هذه النتيجة

تنطبق هذه النتيجة على النظام المحدد وظروف المصدر المعروضة هنا فحسب. ولا تثبت وجود وكيل هو الأفضل عالميًا، أو موثوقية في بيئة الإنتاج، أو حوكمة للبيانات، أو أداءً على إصدار مختلف من المعيار المرجعي.

قارن المتماثل بالمتماثل

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات