معايير Agent
معيار وكلاء WebArena
تُبقي OpenGPT عدد 0 من الصفوف المنشورة مرتبطًا بإصدار المعيار WebArena الدقيق والبيئة الموضحة أدناه.
- المهام
- 812
- صفوف منشورة
- 0
- تاريخ بيانات المصدر
- تمت مراجعة الهوية
- المراجعة مطلوبة
نطاق الأدلة
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
How OpenGPT handles this evidence
تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.
حدود المقارنة
- تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
- تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
- تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
- تحققت OpenGPT من النطاق الرسمي للمعيار، لكنها لم تجمّد بعد لقطة نتائج مكتملة الإعداد وقابلة للمقارنة مباشرة.
v0.2.0 · canonical self-hosted environment
عرض 0 من أصل 0 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.