Agentconfiguratie · SWE-bench Verified

mini-SWE-agent + MiniMax M2.5 (high reasoning)

Het gerangschikte object: model, scaffold, hulpmiddelen, rechten, budget en omgeving samen.

Opgelost75.8%
Kosten per geslaagde taakNiet gepubliceerd
Bereik van gepubliceerde resultatenNiet gepubliceerd

01

Configuratie

Agentsysteemmini-SWE-agent + MiniMax M2.5 (high reasoning)
BasismodelMiniMax M2.5 (high reasoning)
Model-ID of label uit bronminimax-m2.5
Scaffoldmini-SWE-agent
Scaffoldversie2.0.0
HulpmiddelenMinimal repository shell
OmgevingReproduceerbare repositoryomgevingen geëvalueerd door SWE-bench
BudgetLimieten verschillen per ingediende configuratie

02

Resultaat

Opgelost75.8%
Gedeeltelijke scoreNiet gepubliceerd
Kosten per geslaagde taakNiet gepubliceerd
Gerapporteerde benchmarkkostenUS$ 36,64
Mediane voltooiingstijdNiet gepubliceerd
Menselijke tussenkomstNiet gepubliceerd

03

Werking

Bewijs uit herhaalde uitvoeringenNiet gepubliceerd
Bereik van gepubliceerde resultatenNiet gepubliceerd
VeiligheidsnotitieNiet gepubliceerd
Vergelijkbaarheidsgroepswe-bench-verified-full-500
Evaluatiedatum
Gegevens vastgelegd

04

Vertrouwen

BewijsVermeld door de benchmarkuitgever
BronSWE-bench Verified
BronmomentopnameGeverifieerd · Volledige ranglijst · 500 taken
Datum van brongegevens
Opgehaald door OpenGPT
Rangschikking laatst gewijzigdNog geen vergelijkbare geschiedenis
Laatst gecontroleerd
Taken500 door mensen gevalideerde GitHub-issues
BewijsniveauExterne waarschuwing
Bewijsnotitie

Bewaar deze resultaten als Historisch bewijs. Een OpenAI-audit uit 2026 meldde zorgen over het ontwerp en contaminatie in SWE-bench Verified.

Audit openen

Wat dit resultaat niet bewijst

Dit resultaat geldt voor het exacte systeem en de hier getoonde bronvoorwaarden. Het stelt geen universeel beste agent, productiebetrouwbaarheid, gegevensgovernance van prestaties op een andere benchmarkversie vast.

Vergelijk vergelijkbare zaken

Alleen configuraties uit dezelfde benchmarkversie en hetzelfde taakbereik kunnen in één vergelijking worden geplaatst.

Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.

Valideren vóór ingebruikname

Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt van de configuratie bij uw werk past.

  1. 1

    Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.

  2. 2

    Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.

  3. 3

    Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.

  4. 4

    Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.

Agentoverzicht en -evaluaties