معايير Agent
معيار وكلاء Terminal-Bench 2.1
تُبقي OpenGPT عدد 22 من الصفوف المنشورة مرتبطًا بإصدار المعيار Terminal-Bench 2.1 الدقيق والبيئة الموضحة أدناه.
- المهام
- 89
- صفوف منشورة
- 22
- تاريخ بيانات المصدر
- تمت مراجعة الهوية
- حالي
نطاق الأدلة
terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard. terminal tasks. Harbor-managed terminal environments with fixed timeouts and resources. Fixed timeouts and resources · at least 5 trials per task.
How OpenGPT handles this evidence
تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.
حدود المقارنة
- تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
- تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
- تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
- يذكر فريق Terminal-Bench أنه شغّل طلبات لوحة الصدارة وتحقق منها. وتوثق ملاحظات إصدار 2.1 مجموعة مهام وبيئة تقييم منقحتين.
terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
عرض 22 من أصل 22 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.
- Codex · GPT-6 Astra · مرتفعOpenAI · GPT-6 Astra#1Accuracy: 87.4%Codex
- Codex · GPT-6 Astra · متوسطOpenAI · GPT-6 Astra#2Accuracy: 87.0%Codex
- Codex · GPT-6 Astra · منخفضOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
- Codex · GPT-6 Astra · maxOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
- Codex · GPT-6 Astra · xhighOpenAI · GPT-6 Astra#5Accuracy: 85.8%Codex
- Claude Code · Fable 5 · xhighAnthropic · Fable 5#6Accuracy: 83.8%Claude Code
- Codex · GPT-5.5 · xhighOpenAI · GPT-5.5#7Accuracy: 83.2%Codex
- Terminus 2 · Fable 5 · highTerminal-Bench · Fable 5#8Accuracy: 80.5%Terminus 2
- Cursor CLI · Grok 4.5 · highCursor · Grok 4.5#9Accuracy: 79.3%Cursor CLI
- Claude Code · Opus 4.8 · highAnthropic · Opus 4.8#10Accuracy: 78.9%Claude Code
- Codex · GPT-5.6 Terra · maxOpenAI · GPT-5.6 Terra#11Accuracy: 78.4%Codex
- Terminus 2 · GPT-5.5 · xhighTerminal-Bench · GPT-5.5#12Accuracy: 78.0%Terminus 2
- mini-SWE-agent · Muse Spark 1.1 · xhighPrinceton · Muse Spark 1.1#13Accuracy: 76.2%mini-SWE-agent
- Codex · GPT-5.6 Luna · maxOpenAI · GPT-5.6 Luna#14Accuracy: 75.7%Codex
- Claude Code · Sonnet 5 · highAnthropic · Sonnet 5#15Accuracy: 74.6%Claude Code
- Terminus 2 · Gemini 3 Pro · highTerminal-Bench · Gemini 3 Pro#16Accuracy: 73.9%Terminus 2
- Claude Code · Opus 4.7 · maxAnthropic · Opus 4.7#17Accuracy: 68.9%Claude Code
- Terminus 2 · Opus 4.7 · maxTerminal-Bench · Opus 4.7#18Accuracy: 66.1%Terminus 2
- Gemini CLI · Gemini 3 Pro · highGoogle · Gemini 3 Pro#19Accuracy: 65.8%Gemini CLI
- Gemini CLI · Gemini 3.1 Pro · highGoogle · Gemini 3.1 Pro#19Accuracy: 65.8%Gemini CLI
- Terminus 2 · Gemini 3.1 Pro · highTerminal-Bench · Gemini 3.1 Pro#21Accuracy: 65.6%Terminus 2
- Claude Code · GLM-5.1 · maxAnthropic · GLM-5.1#22Accuracy: 58.6%Claude Code