نطاق معياري مشترك · SWE-bench Verified

مقارنة الوكلاء ضمن المعيار نفسه

تشترك الإدخالات أدناه في نطاق المعيار المرجعي نفسه. وتظل بنياتها التوجيهية الدقيقة وإصدارات نماذجها وتواريخها وقيم المصدر الأصلية ظاهرة.

تعني قيمة المصدر الأعلى أداءً أفضل في هذا المعيار والتكوين فقط. وليست درجة عابرة للمعايير أو مؤشرًا للجاهزية للإنتاج.

قارن المتماثل بالمتماثل

نظرة عامة على القرار

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.
UIUClive-SWE-agent + Claude 4.5 Opus medium (20251101)
محلول79.2%التكلفة لكل مهمة ناجحةغير منشورنطاق النتائج المنشورةغير منشور
تفاصيل Agent
UIUClive-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
محلول77.4%التكلفة لكل مهمة ناجحةغير منشورنطاق النتائج المنشورةغير منشور
تفاصيل Agent
أُخفي 17 من الحقول المتطابقة أو غير المُبلّغ عنها بالكامل
نظام Agentlive-SWE-agent + Claude 4.5 Opus medium (20251101)live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)
الإعداد
النموذج الأساسيClaude 4.5 Opus medium (20251101)Gemini 3 Pro Preview (2025-11-18)
معرّف نموذج المصدر أو تسميتهclaude-opus-4-5-20251101gemini-3-pro-preview
النتيجة
محلول79.2%77.4%
الثقة
تاريخ التقييم15 ديسمبر 202520 نوفمبر 2025
المصدر
فتح المصدرفتح المصدرفتح المصدر

الإعداد

live-SWE-agent + Claude 4.5 Opus medium (20251101)

النموذج الأساسي
Claude 4.5 Opus medium (20251101)
معرّف نموذج المصدر أو تسميته
claude-opus-4-5-20251101

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

النموذج الأساسي
Gemini 3 Pro Preview (2025-11-18)
معرّف نموذج المصدر أو تسميته
gemini-3-pro-preview

النتيجة

live-SWE-agent + Claude 4.5 Opus medium (20251101)

محلول
79.2%

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

محلول
77.4%

الثقة

live-SWE-agent + Claude 4.5 Opus medium (20251101)

تاريخ التقييم
15 ديسمبر 2025

live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)

تاريخ التقييم
20 نوفمبر 2025

المصدر

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات