تكوين Agent · τ³-Banking Knowledge

τ³ Banking AllTools · Grok 4.1 fast · high

العنصر المرتّب: النموذج والبنية التوجيهية والأدوات والأذونات والميزانية والبيئة معًا.

اجتياز¹13.14%
التكلفة لكل مهمة ناجحةغير منشور
نطاق النتائج المنشورةغير منشور

01

الإعداد

نظام Agentτ³ Banking AllTools · Grok 4.1 fast · high
النموذج الأساسيGrok 4.1 fast
معرّف نموذج المصدر أو تسميتهGrok 4.1 fast · high
البنيةτ³ standard agent
إصدار القالب الأوليv1.0.1
أدواتAllTools: BM25, text-embedding-3-large retrieval, and sandboxed shell
البيئةقالب أولي قياسي مع BM25 واسترجاع بالتضمينات وبحث معزول في سطر الأوامر
الميزانية4 تجارب لكل مهمة · 388 مسارًا لكل تكوين

02

النتيجة

اجتياز¹13.14%
درجة جزئيةغير منشور
التكلفة لكل مهمة ناجحةغير منشور
تكلفة المعيار المبلغ عنهاغير مُبلّغ عنه
الوسيط الزمني للإكمالغير منشور
التدخل البشريغير منشور

03

العملية

أدلة التشغيل المتكرر4 من عمليات التشغيل
نطاق النتائج المنشورةغير منشور
ملاحظة أمانغير منشور
مجموعة القابلية للمقارنةtau3-banking-v1-0-1-alltools-gpt-5-2-low-seed-300-4-trials
تاريخ التقييم
البيانات الملتقطة

04

الثقة

الأدلةمدرج لدى ناشر المعيار
المصدرSierra Research · τ³-Banking
لقطة المصدرv1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials
تاريخ بيانات المصدر
استرجعها OpenGPT
آخر تغيير للترتيب
آخر فحص
المهام97 مهام المعرفة المصرفية
مستوى الأدلةيتولى الناشر صيانته
ملاحظة الأدلة

تشترك الصفوف المدرجة في المعيار v1.0.1، وتقسيم Banking Knowledge المكوّن من 97 مهمة، وإعداد AllTools، ومحاكي المستخدم، والقيمة الابتدائية، وبروتوكول من أربع تجارب. وتظل التكاليف غير المتاحة مجهولة.

فتح التدقيق

ما الذي لا تثبته هذه النتيجة

تنطبق هذه النتيجة على النظام المحدد وظروف المصدر المعروضة هنا فحسب. ولا تثبت وجود وكيل هو الأفضل عالميًا، أو موثوقية في بيئة الإنتاج، أو حوكمة للبيانات، أو أداءً على إصدار مختلف من المعيار المرجعي.

قارن المتماثل بالمتماثل

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات