معايير Agent

معيار وكلاء Terminal-Bench 2.1

تُبقي OpenGPT عدد 22 من الصفوف المنشورة مرتبطًا بإصدار المعيار Terminal-Bench 2.1 الدقيق والبيئة الموضحة أدناه.

المهام
89
صفوف منشورة
22
تاريخ بيانات المصدر
تمت مراجعة الهوية
حالي

نطاق الأدلة

terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard. terminal tasks. Harbor-managed terminal environments with fixed timeouts and resources. Fixed timeouts and resources · at least 5 trials per task.

How OpenGPT handles this evidence

تحافظ OpenGPT على مقياس الناشر ونطاق المهمة والبيئة والإصدار وحقول الإعداد وتاريخ المصدر. ولا تنشئ درجة إجمالية للوكلاء عبر معايير مختلفة.

حدود المقارنة

  • تنطبق النتيجة الأعلى فقط على إصدار المعيار والشروط المعروضة.
  • تعكس نتائج Agent النظام الكامل، وليس النموذج الأساسي وحده.
  • تظل بيانات التكلفة أو الموثوقية أو السلامة أو زمن الاستجابة المفقودة غير مُبلّغ عنها بدلًا من استنتاجها.
  • يذكر فريق Terminal-Bench أنه شغّل طلبات لوحة الصدارة وتحقق منها. وتوثق ملاحظات إصدار 2.1 مجموعة مهام وبيئة تقييم منقحتين.

terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard

عرض 22 من أصل 22 من الصفوف المنشورة. تبقى كل نتيجة مرتبطة بمعيار المصدر وإعداده.

  1. Codex · GPT-6 Astra · مرتفعOpenAI · GPT-6 Astra#1Accuracy: 87.4%Codex
  2. Codex · GPT-6 Astra · متوسطOpenAI · GPT-6 Astra#2Accuracy: 87.0%Codex
  3. Codex · GPT-6 Astra · منخفضOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
  4. Codex · GPT-6 Astra · maxOpenAI · GPT-6 Astra#3Accuracy: 86.7%Codex
  5. Codex · GPT-6 Astra · xhighOpenAI · GPT-6 Astra#5Accuracy: 85.8%Codex
  6. Claude Code · Fable 5 · xhighAnthropic · Fable 5#6Accuracy: 83.8%Claude Code
  7. Codex · GPT-5.5 · xhighOpenAI · GPT-5.5#7Accuracy: 83.2%Codex
  8. Terminus 2 · Fable 5 · highTerminal-Bench · Fable 5#8Accuracy: 80.5%Terminus 2
  9. Cursor CLI · Grok 4.5 · highCursor · Grok 4.5#9Accuracy: 79.3%Cursor CLI
  10. Claude Code · Opus 4.8 · highAnthropic · Opus 4.8#10Accuracy: 78.9%Claude Code
  11. Codex · GPT-5.6 Terra · maxOpenAI · GPT-5.6 Terra#11Accuracy: 78.4%Codex
  12. Terminus 2 · GPT-5.5 · xhighTerminal-Bench · GPT-5.5#12Accuracy: 78.0%Terminus 2
  13. mini-SWE-agent · Muse Spark 1.1 · xhighPrinceton · Muse Spark 1.1#13Accuracy: 76.2%mini-SWE-agent
  14. Codex · GPT-5.6 Luna · maxOpenAI · GPT-5.6 Luna#14Accuracy: 75.7%Codex
  15. Claude Code · Sonnet 5 · highAnthropic · Sonnet 5#15Accuracy: 74.6%Claude Code
  16. Terminus 2 · Gemini 3 Pro · highTerminal-Bench · Gemini 3 Pro#16Accuracy: 73.9%Terminus 2
  17. Claude Code · Opus 4.7 · maxAnthropic · Opus 4.7#17Accuracy: 68.9%Claude Code
  18. Terminus 2 · Opus 4.7 · maxTerminal-Bench · Opus 4.7#18Accuracy: 66.1%Terminus 2
  19. Gemini CLI · Gemini 3 Pro · highGoogle · Gemini 3 Pro#19Accuracy: 65.8%Gemini CLI
  20. Gemini CLI · Gemini 3.1 Pro · highGoogle · Gemini 3.1 Pro#19Accuracy: 65.8%Gemini CLI
  21. Terminus 2 · Gemini 3.1 Pro · highTerminal-Bench · Gemini 3.1 Pro#21Accuracy: 65.6%Terminus 2
  22. Claude Code · GLM-5.1 · maxAnthropic · GLM-5.1#22Accuracy: 58.6%Claude Code