معايير Agent

معيار وكلاء WebArena

تُبقي OpenGPT عدد 0 من الصفوف المنشورة مرتبطًا بإصدار المعيار WebArena الدقيق والبيئة الموضحة أدناه.

المهام
812
صفوف منشورة
0
تاريخ بيانات المصدر
تمت مراجعة الهوية
المراجعة مطلوبة

نطاق الأدلة

v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.

How OpenGPT handles this evidence

تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.

حدود المقارنة

  • تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
  • تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
  • تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
  • تحققت OpenGPT من النطاق الرسمي للمعيار، لكنها لم تجمّد بعد لقطة نتائج مكتملة الإعداد وقابلة للمقارنة مباشرة.

v0.2.0 · canonical self-hosted environment

عرض 0 من أصل 0 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.