تكوين Agent · AssistantBench

Browser-Use · GPT-5 Medium (August 2025)

العنصر المرتّب: النموذج والبنية التوجيهية والأدوات والأذونات والميزانية والبيئة معًا.

الدقة35.23%
التكلفة لكل مهمة ناجحة‏3.59 US$
نطاق النتائج المنشورةغير منشور

01

الإعداد

نظام AgentBrowser-Use · GPT-5 Medium (August 2025)
النموذج الأساسيGPT-5 Medium (August 2025)
معرّف نموذج المصدر أو تسميتهGPT-5 Medium (August 2025)
البنيةBrowser-Use
إصدار القالب الأوليغير مُبلّغ عنه
أدواتBrowser-Use live-web browser automation
البيئةمهام البحث والتصفح المباشر عبر الويب التي أعادت Holistic Agent Leaderboard إنتاجها
الميزانيةخاص بالمصدر · لم يُنشر حد موحّد للخطوات أو الرموز المميزة

02

النتيجة

الدقة35.23%
درجة جزئيةغير منشور
التكلفة لكل مهمة ناجحة‏3.59 US$
تكلفة المعيار المبلغ عنها‏41.69 US$
الوسيط الزمني للإكمالغير منشور
التدخل البشريغير منشور

03

العملية

أدلة التشغيل المتكرر1 من عمليات التشغيل
نطاق النتائج المنشورةغير منشور
ملاحظة أمانغير منشور
مجموعة القابلية للمقارنةhal-assistantbench-public-33-browser-use
تاريخ التقييمغير منشور
البيانات الملتقطة

04

الثقة

الأدلةسجل تشغيل عام مكتمل
المصدرHolistic Agent Leaderboard · AssistantBench
لقطة المصدرلقطة HAL متحقق منها · 33 مهمة عامة · بنية واحدة
تاريخ بيانات المصدرلم ينشره المصدر
استرجعها OpenGPT
آخر تغيير للترتيبلا يوجد سجل قابل للمقارنة بعد
آخر فحص
المهام33 مهام تصفح عامة قابلة للتحقق تلقائيًا
مستوى الأدلةتنبيه خارجي
ملاحظة الأدلة

أعاد HAL إنتاج هذه الصفوف العامة وينشر المسارات والتكاليف وأعداد مرات التشغيل. تعامل مع اللقطة بوصفها تاريخية: أوقف HAL إضافة نماذج جديدة، ولا تشمل التكاليف المبلغ عنها مزايا التخزين المؤقت.

فتح التدقيق

ما الذي لا تثبته هذه النتيجة

تنطبق هذه النتيجة على النظام المحدد وظروف المصدر المعروضة هنا فحسب. ولا تثبت وجود وكيل هو الأفضل عالميًا، أو موثوقية في بيئة الإنتاج، أو حوكمة للبيانات، أو أداءً على إصدار مختلف من المعيار المرجعي.

قارن المتماثل بالمتماثل

لا يمكن وضع إعدادات في مقارنة واحدة إلا إذا كانت من إصدار المعيار ونطاق المهمة نفسيهما.

بيانات أبلغ عنها المصدر؛ تبقى القيم المفقودة مجهولة.

تحقّق قبل الاعتماد

تنشئ التصنيفات العامة قائمة مختصرة. وتحدد تجربة خاصة صغيرة ما إذا كان الإعداد يلائم عملك.

  1. 1

    اختر من 10 إلى 20 مهمة تمثيلية وحدد شرط اجتياز واضحًا.

  2. 2

    ثبّت الوكيل والنموذج والأدوات والأذونات والميزانية قبل الاختبار.

  3. 3

    نفّذ كل مهمة مهمة أكثر من مرة؛ وسجّل النجاح والتكلفة والوقت وحالات تولي الإنسان للمهمة.

  4. 4

    راجع الإخفاقات ومخاطر معالجة البيانات قبل اتخاذ قرار بشأن بيئة الإنتاج.

دليل Agent والتقييمات