نطاق معياري مشترك · SWE-bench Verified

مقارنة الوكلاء ضمن المعيار نفسه

تشترك الإدخالات أدناه في نطاق المعيار المرجعي نفسه. وتظل بنياتها التوجيهية الدقيقة وإصدارات نماذجها وتواريخها وقيم المصدر الأصلية ظاهرة.

تعني قيمة المصدر الأعلى أداءً أفضل في هذا المعيار والتكوين فقط. وليست درجة عابرة للمعايير أو مؤشرًا للجاهزية للإنتاج.

قارن المتماثل بالمتماثل

نظرة عامة على القرار

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.
UIUClive-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
محلول77.4%التكلفة لكل مهمة ناجحةغير منشورنطاق النتائج المنشورةغير منشور
تفاصيل Agent
UIUClive-SWE-agent + Claude 4.5 Opus medium (20251101)
محلول79.2%التكلفة لكل مهمة ناجحةغير منشورنطاق النتائج المنشورةغير منشور
تفاصيل Agent
أُخفي 17 من الحقول المتطابقة أو غير المُبلّغ عنها بالكامل
نظام Agentlive-SWE-agent + Gemini 3 Pro Preview (2025-11-18)live-SWE-agent + Claude 4.5 Opus medium (20251101)
الإعداد
النموذج الأساسيGemini 3 Pro Preview (2025-11-18)Claude 4.5 Opus medium (20251101)
معرّف نموذج المصدر أو تسميتهgemini-3-pro-previewclaude-opus-4-5-20251101
النتيجة
محلول77.4%79.2%
الثقة
تاريخ التقييم20 نوفمبر 202515 ديسمبر 2025
المصدر
فتح المصدرفتح المصدرفتح المصدر

الإعداد

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

النموذج الأساسي
Gemini 3 Pro Preview (2025-11-18)
معرّف نموذج المصدر أو تسميته
gemini-3-pro-preview

live-SWE-agent + Claude 4.5 Opus medium (20251101)

النموذج الأساسي
Claude 4.5 Opus medium (20251101)
معرّف نموذج المصدر أو تسميته
claude-opus-4-5-20251101

النتيجة

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

محلول
77.4%

live-SWE-agent + Claude 4.5 Opus medium (20251101)

محلول
79.2%

الثقة

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

تاريخ التقييم
20 نوفمبر 2025

live-SWE-agent + Claude 4.5 Opus medium (20251101)

تاريخ التقييم
15 ديسمبر 2025

المصدر

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات