Agent 配置 · SWE-bench Verified

mini-SWE-agent + MiniMax M2.5 (high reasoning)

榜單評估的完整對象,包括模型、框架、工具、權限、預算與執行環境。

系統身分

Agent 系統mini-SWE-agent + MiniMax M2.5 (high reasoning)
基礎模型MiniMax M2.5 (high reasoning)
來源模型 ID 或名稱minimax-m2.5
Agent 框架mini-SWE-agent
Agent 框架版本2.0.0
工具Minimal repository shell
可比較組swe-bench-verified-full-500

評測配置

資料快照SWE-bench Verified · Verified · 完整 Agent 榜單 · 500 項工作 · 2026年7月30日
工作數500 經人工核驗的 GitHub 問題
執行環境由 SWE-bench 評估的可重現程式碼倉庫環境
預算上限取決於各提交配置
評測日期
資料取得日期
問題解決率75.8%
部分完成分未提供

公開證據

開啟來源
證據狀態已列入基準官方榜單
資料來源SWE-bench Verified
成本US$36.64
成本口徑來源提供的整套評測成本

此結果不能說明什麼

結果只適用於此處顯示的完整系統與來源條件,不能證明萬用 Agent、正式環境可靠性、資料治理或其他版本的表現。

全部 AI Agent 榜單