معايير Agent

معيار وكلاء GAIA

تُبقي OpenGPT عدد 15 من الصفوف المنشورة مرتبطًا بإصدار المعيار GAIA الدقيق والبيئة الموضحة أدناه.

المهام
165
صفوف منشورة
15
تاريخ بيانات المصدر
تمت مراجعة الهوية
تاريخي

نطاق الأدلة

HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions. public validation questions. General-assistant questions requiring reasoning, multimodality, browsing, and tools. Source-specific; no normalized step or token limit published.

How OpenGPT handles this evidence

تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.

حدود المقارنة

  • تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
  • تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
  • تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
  • أعاد HAL إنتاج صفوف التحقق العامة هذه وينشر البنية والنموذج والدرجة والتكلفة وعدد مرات التشغيل والمسارات. أوقف المصدر إضافة نماذج جديدة، ولا ينشر ميزانية أدوات أو خطوات موحدة.

HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions

عرض 15 من أصل 15 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.

  1. HAL Generalist Agent · Claude Sonnet 4.5 (September 2025)Holistic Agent Leaderboard · Claude Sonnet 4.5 (September 2025)#1Accuracy: 74.55%HAL Generalist Agent
  2. HAL Generalist Agent · Claude Sonnet 4.5 High (September 2025)Holistic Agent Leaderboard · Claude Sonnet 4.5 High (September 2025)#2Accuracy: 70.91%HAL Generalist Agent
  3. HAL Generalist Agent · Claude Opus 4.1 High (August 2025)Holistic Agent Leaderboard · Claude Opus 4.1 High (August 2025)#3Accuracy: 68.48%HAL Generalist Agent
  4. HAL Generalist Agent · Claude Opus 4 High (May 2025)Holistic Agent Leaderboard · Claude Opus 4 High (May 2025)#4Accuracy: 64.85%HAL Generalist Agent
  5. HAL Generalist Agent · Claude-3.7 Sonnet High (February 2025)Holistic Agent Leaderboard · Claude-3.7 Sonnet High (February 2025)#5Accuracy: 64.24%HAL Generalist Agent
  6. HAL Generalist Agent · Claude Opus 4.1 (August 2025)Holistic Agent Leaderboard · Claude Opus 4.1 (August 2025)#6Accuracy: 64.24%HAL Generalist Agent
  7. HF Open Deep Research · GPT-5 Medium (August 2025)Hugging Face · GPT-5 Medium (August 2025)#7Accuracy: 62.80%HF Open Deep Research
  8. HAL Generalist Agent · GPT-5 Medium (August 2025)Holistic Agent Leaderboard · GPT-5 Medium (August 2025)#8Accuracy: 59.39%HAL Generalist Agent
  9. HAL Generalist Agent · o4-mini Low (April 2025)Holistic Agent Leaderboard · o4-mini Low (April 2025)#9Accuracy: 58.18%HAL Generalist Agent
  10. HF Open Deep Research · Claude Opus 4 (May 2025)Hugging Face · Claude Opus 4 (May 2025)#10Accuracy: 57.58%HF Open Deep Research
  11. HAL Generalist Agent · Claude-3.7 Sonnet (February 2025)Holistic Agent Leaderboard · Claude-3.7 Sonnet (February 2025)#11Accuracy: 56.36%HAL Generalist Agent
  12. HAL Generalist Agent · Claude Haiku 4.5 (October 2025)Holistic Agent Leaderboard · Claude Haiku 4.5 (October 2025)#12Accuracy: 56.36%HAL Generalist Agent
  13. HF Open Deep Research · o4-mini High (April 2025)Hugging Face · o4-mini High (April 2025)#13Accuracy: 55.76%HF Open Deep Research
  14. HAL Generalist Agent · o4-mini High (April 2025)Holistic Agent Leaderboard · o4-mini High (April 2025)#14Accuracy: 54.55%HAL Generalist Agent
  15. HF Open Deep Research · GPT-4.1 (April 2025)Hugging Face · GPT-4.1 (April 2025)#15Accuracy: 50.30%HF Open Deep Research