معايير Agent
معيار وكلاء τ²-bench Core
تُبقي OpenGPT عدد 8 من الصفوف المنشورة مرتبطًا بإصدار المعيار τ²-bench Core الدقيق والبيئة الموضحة أدناه.
- المهام
- 278
- صفوف منشورة
- 8
- تاريخ بيانات المصدر
- تمت مراجعة الهوية
- حالي
نطاق الأدلة
v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials. base tasks across retail, airline, and telecom. Standard agent, standard domain tools, and a shared GPT-5.2 low-reasoning user simulator. 4 trials per task · 1,112 trajectories per configuration.
How OpenGPT handles this evidence
تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.
حدود المقارنة
- تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
- تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
- تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
- لا تتضمن OpenGPT سوى الصفوف الثمانية التي أرسلها الناشر وتشترك في المعيار v1.0.1 والقالب والأدوات القياسية ومحاكي المستخدم نفسه وتقسيمات المهام الأساسية نفسها وأربع تجارب. وتظل صفوف τ-bench الأخرى خارج هذا النطاق.
v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
عرض 8 من أصل 8 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.
- τ² standard agent · Qwen3.5-397B-A17B · thinkingAlibaba Cloud · Qwen3.5-397B-A17B#1Average Pass¹: 87.91%τ² standard agent
- τ² standard agent · Claude Opus 4.5 · مرتفعAnthropic · Claude Opus 4.5#2Average Pass¹: 85.31%τ² standard agent
- τ² standard agent · GPT-5.2 · مرتفعOpenAI · GPT-5.2#3Average Pass¹: 84.76%τ² standard agent
- τ² standard agent · Gemini 3 Flash Preview · مرتفعGoogle · Gemini 3 Flash Preview#4Average Pass¹: 83.49%τ² standard agent
- τ² standard agent · Gemini 3 Pro Preview · مرتفعGoogle · Gemini 3 Pro Preview#5Average Pass¹: 82.46%τ² standard agent
- τ² standard agent · GLM-5 · thinkingZhipu AI · GLM-5#6Average Pass¹: 81.01%τ² standard agent
- τ² standard agent · Claude Sonnet 4.5 · تفكير موسعAnthropic · Claude Sonnet 4.5#7Average Pass¹: 76.41%τ² standard agent
- τ² standard agent · GPT-5.2 · من دون استدلالOpenAI · GPT-5.2#8Average Pass¹: 61.58%τ² standard agent