معايير Agent

معيار وكلاء AssistantBench

تُبقي OpenGPT عدد 15 من الصفوف المنشورة مرتبطًا بإصدار المعيار AssistantBench الدقيق والبيئة الموضحة أدناه.

المهام
33
صفوف منشورة
15
تاريخ بيانات المصدر
تمت مراجعة الهوية
تاريخي

نطاق الأدلة

HAL verified snapshot · 33 public tasks · 1 scaffold. public, automatically verifiable browsing tasks. Live-web research and browsing tasks reproduced بواسطة the Holistic Agent Leaderboard. Source-specific; no normalized step or token limit published.

How OpenGPT handles this evidence

تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.

حدود المقارنة

  • تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
  • تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
  • تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
  • أعاد HAL إنتاج هذه الصفوف وينشر المسارات والتكاليف وأعداد مرات التشغيل. لوحة الصدارة لقطة تاريخية: أوقف HAL إضافة نماذج جديدة، ولا تشمل التكاليف المبلغ عنها مزايا التخزين المؤقت.

لقطة HAL متحقق منها · 33 مهمة عامة · بنية واحدة

عرض 15 من أصل 15 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.

  1. Browser-Use · o3 Medium (April 2025)Browser Use · o3 Medium (April 2025)#1Accuracy: 38.81%Browser-Use
  2. Browser-Use · GPT-5 Medium (August 2025)Browser Use · GPT-5 Medium (August 2025)#2Accuracy: 35.23%Browser-Use
  3. Browser-Use · o4-mini Low (April 2025)Browser Use · o4-mini Low (April 2025)#3Accuracy: 28.05%Browser-Use
  4. Browser-Use · o4-mini High (April 2025)Browser Use · o4-mini High (April 2025)#4Accuracy: 23.84%Browser-Use
  5. Browser-Use · GPT-4.1 (April 2025)Browser Use · GPT-4.1 (April 2025)#5Accuracy: 17.39%Browser-Use
  6. Browser-Use · Claude-3.7 Sonnet (February 2025)Browser Use · Claude-3.7 Sonnet (February 2025)#6Accuracy: 16.69%Browser-Use
  7. Browser-Use · Claude Opus 4.1 High (August 2025)Browser Use · Claude Opus 4.1 High (August 2025)#7Accuracy: 13.75%Browser-Use
  8. Browser-Use · Claude-3.7 Sonnet High (February 2025)Browser Use · Claude-3.7 Sonnet High (February 2025)#8Accuracy: 13.08%Browser-Use
  9. Browser-Use · Claude Sonnet 4.5 High (September 2025)Browser Use · Claude Sonnet 4.5 High (September 2025)#9Accuracy: 11.80%Browser-Use
  10. Browser-Use · DeepSeek R1 (May 2025)Browser Use · DeepSeek R1 (May 2025)#10Accuracy: 8.75%Browser-Use
  11. Browser-Use · Claude Opus 4.1 (August 2025)Browser Use · Claude Opus 4.1 (August 2025)#11Accuracy: 7.26%Browser-Use
  12. Browser-Use · Claude Sonnet 4.5 (September 2025)Browser Use · Claude Sonnet 4.5 (September 2025)#12Accuracy: 7.09%Browser-Use
  13. Browser-Use · Gemini 2.0 Flash (February 2025)Browser Use · Gemini 2.0 Flash (February 2025)#13Accuracy: 2.62%Browser-Use
  14. Browser-Use · DeepSeek V3 (March 2025)Browser Use · DeepSeek V3 (March 2025)#14Accuracy: 2.03%Browser-Use
  15. Browser-Use · DeepSeek R1 (January 2025)Browser Use · DeepSeek R1 (January 2025)#15Accuracy: 0.00%Browser-Use