معايير Agent
معيار وكلاء τ³-Banking Knowledge
تُبقي OpenGPT عدد 21 من الصفوف المنشورة مرتبطًا بإصدار المعيار τ³-Banking Knowledge الدقيق والبيئة الموضحة أدناه.
- المهام
- 97
- صفوف منشورة
- 21
- تاريخ بيانات المصدر
- تمت مراجعة الهوية
- حالي
نطاق الأدلة
v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials. banking knowledge tasks. Standard scaffold with BM25, embedding retrieval, and sandboxed command-line search. 4 trials per task · 388 trajectories per configuration.
How OpenGPT handles this evidence
تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.
حدود المقارنة
- تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
- تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
- تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
- تستخدم الصفوف المدرجة إصدار المعيار المرجعي نفسه، وتقسيم Banking Knowledge المؤلف من 97 مهمة، وتهيئة AllTools، ومحاكي المستخدم، والبذرة، وبروتوكول أربع تجارب. وتظل التكاليف المفقودة غير مُبلّغ عنها. تتضمن هذه اللقطة جميع طلبات الناشرين المتوافقة وعددها 21 والمتاحة في المراجعة المثبتة.
v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials
عرض 21 من أصل 21 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.
- τ³ Banking AllTools · Qwen 3.8 Max · xhighQwen · Qwen 3.8 Max#1Pass¹: 55.15%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 5 · maxAnthropic · Claude Opus 5#2Pass¹: 48.71%τ³ standard agent
- τ³ Banking AllTools · Grok 4.5 · مرتفعxAI · Grok 4.5#3Pass¹: 47.94%τ³ standard agent
- τ³ Banking AllTools · GPT-5.6-sol · xhighOpenAI · GPT-5.6-sol#4Pass¹: 46.91%τ³ standard agent
- τ³ Banking AllTools · GPT-5.5 · xhighOpenAI · GPT-5.5#5Pass¹: 44.59%τ³ standard agent
- τ³ Banking AllTools · Muse Spark 1.1 · xhighMeta · Muse Spark 1.1#6Pass¹: 40.46%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.7 · maxAnthropic · Claude Opus 4.7#7Pass¹: 40.21%τ³ standard agent
- τ³ Banking AllTools · Claude Fable 5 · maxAnthropic · Claude Fable 5#8Pass¹: 39.69%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.8 · maxAnthropic · Claude Opus 4.8#9Pass¹: 39.69%τ³ standard agent
- τ³ Banking AllTools · GPT-5.4 · xhighOpenAI · GPT-5.4#10Pass¹: 39.43%τ³ standard agent
- τ³ Banking AllTools · GLM-5.2 · xhighZ.ai · GLM-5.2#11Pass¹: 37.11%τ³ standard agent
- τ³ Banking AllTools · Kimi K3 · maxMoonshot AI · Kimi K3#12Pass¹: 37.11%τ³ standard agent
- τ³ Banking AllTools · GPT-5.2 · مرتفعOpenAI · GPT-5.2#13Pass¹: 32.22%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.6 · maxAnthropic · Claude Opus 4.6#14Pass¹: 27.32%τ³ standard agent
- τ³ Banking AllTools · Gemini 3.1 Pro Preview · مرتفعGoogle · Gemini 3.1 Pro Preview#15Pass¹: 26.03%τ³ standard agent
- τ³ Banking AllTools · Inkling · maxThinking Machines Lab · Inkling#16Pass¹: 25.00%τ³ standard agent
- τ³ Banking AllTools · Claude Opus 4.5 · مرتفعAnthropic · Claude Opus 4.5#17Pass¹: 24.74%τ³ standard agent
- τ³ Banking AllTools · Grok 4.2 · مرتفعxAI · Grok 4.2#18Pass¹: 18.04%τ³ standard agent
- τ³ Banking AllTools · Grok 4 fast · مرتفعxAI · Grok 4 fast#19Pass¹: 15.72%τ³ standard agent
- τ³ Banking AllTools · Gemini 2.5 Pro · مرتفعGoogle · Gemini 2.5 Pro#20Pass¹: 13.66%τ³ standard agent
- τ³ Banking AllTools · Grok 4.1 fast · مرتفعxAI · Grok 4.1 fast#21Pass¹: 13.14%τ³ standard agent