تكوين Agent · τ²-bench Core

τ² standard agent · Claude Sonnet 4.5 · extended thinking

العنصر المرتّب: النموذج والبنية التوجيهية والأدوات والأذونات والميزانية والبيئة معًا.

متوسط Pass¹76.41%
التكلفة لكل مهمة ناجحةغير منشور
نطاق النتائج المنشورةغير منشور

01

الإعداد

نظام Agentτ² standard agent · Claude Sonnet 4.5 · extended thinking
النموذج الأساسيClaude Sonnet 4.5
معرّف نموذج المصدر أو تسميتهClaude Sonnet 4.5 · extended thinking
البنيةτ² standard agent
إصدار القالب الأوليv1.0.1
أدواتStandard retail, airline, and telecom domain tools
البيئةوكيل قياسي وأدوات للمجال مع محاكي مستخدم مشترك بإعداد GPT-5.2 ومستوى الاستدلال low
الميزانية4 تجارب لكل مهمة · 1,112 مسارًا لكل تكوين

02

النتيجة

متوسط Pass¹76.41%
درجة جزئيةغير منشور
التكلفة لكل مهمة ناجحةغير منشور
تكلفة المعيار المبلغ عنهاغير مُبلّغ عنه
الوسيط الزمني للإكمالغير منشور
التدخل البشريغير منشور

03

العملية

أدلة التشغيل المتكرر4 من عمليات التشغيل
نطاق النتائج المنشورةغير منشور
ملاحظة أمانغير منشور
مجموعة القابلية للمقارنةtau2-v1-0-1-base-standard-gpt-5-2-low-4-trials
تاريخ التقييم
البيانات الملتقطة

04

الثقة

الأدلةمدرج لدى ناشر المعيار
المصدرSierra Research · τ²-bench
لقطة المصدرv1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
تاريخ بيانات المصدر
استرجعها OpenGPT
آخر تغيير للترتيبلا يوجد سجل قابل للمقارنة بعد
آخر فحص
المهام278 مهام أساسية في قطاعات التجزئة والطيران والاتصالات
مستوى الأدلةيتولى الناشر صيانته
ملاحظة الأدلة

لا تشمل المقارنة سوى ثمانية صفوف أرسلها الناشر وتشترك في المعيار v1.0.1 والقالب والأدوات القياسية ومحاكي المستخدم وتقسيمات المهام الأساسية وبروتوكول من أربع تجارب. وتظل صفوف τ-bench الأخرى خارج هذا النطاق.

فتح التدقيق

ما الذي لا تثبته هذه النتيجة

تنطبق هذه النتيجة على النظام المحدد وظروف المصدر المعروضة هنا فحسب. ولا تثبت وجود وكيل هو الأفضل عالميًا، أو موثوقية في بيئة الإنتاج، أو حوكمة للبيانات، أو أداءً على إصدار مختلف من المعيار المرجعي.

قارن المتماثل بالمتماثل

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات