AI Agent-directory en -evaluaties

Zoek geverifieerde Agent-producten en vergelijk gepubliceerde configuraties vervolgens alleen binnen hetzelfde benchmarkbereik.

Top 3 van de evaluatieSWE-bench Verified · Opgelost · 10 Vergelijkbare configuraties
  1. Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. Rang 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. Rang 3TRAE + Doubao-Seed-CodeByteDance78.8%

Programmeren

Kies een taakcategorie
Momentopname en wijzigingenEr is nog geen eerdere vergelijkbare momentopname opgeslagen.Actuele bronsnapshot
  1. Rang 1
    Basismodel
    Claude 4.5 Opus medium (20251101)
    Scaffold
    live-SWE-agent
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    Niet gepubliceerd
    Opgelost
    79.2%
  2. Rang 1
    Basismodel
    Claude 4.5 Opus
    Scaffold
    Sonar Foundation Agent
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    Niet gepubliceerd
    Opgelost
    79.2%
  3. Rang 3
    Basismodel
    Doubao-Seed-Code + Doubao-Seed-1.6
    Scaffold
    TRAE
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    Niet gepubliceerd
    Opgelost
    78.8%
  4. Rang 4
    Basismodel
    Gemini 3 Pro Preview (2025-11-18)
    Scaffold
    live-SWE-agent
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    Niet gepubliceerd
    Opgelost
    77.4%
  5. Rang 5
    Basismodel
    Claude Sonnet 4 + GPT-5
    Scaffold
    Atlassian Rovo Dev
    Scaffoldversie
    2025-09-02
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    Niet gepubliceerd
    Opgelost
    76.8%
  6. Rang 5
    Basismodel
    Claude 4 Sonnet
    Scaffold
    EPAM AI/Run Developer Agent
    Scaffoldversie
    v20250719
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    Niet gepubliceerd
    Opgelost
    76.8%
  7. Rang 5
    Basismodel
    Claude 4.5 Opus (high reasoning)
    Scaffold
    mini-SWE-agent
    Scaffoldversie
    2.0.0
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    US$ 376,95
    Opgelost
    76.8%
  8. Rang 8

    ACoder

    ACoder
    Basismodel
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Scaffold
    ACoder
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    Niet gepubliceerd
    Opgelost
    76.4%
  9. Rang 9
    Basismodel
    Gemini 3 Flash (high reasoning)
    Scaffold
    mini-SWE-agent
    Scaffoldversie
    2.0.0
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    US$ 177,98
    Opgelost
    75.8%
  10. Rang 9
    Basismodel
    MiniMax M2.5 (high reasoning)
    Scaffold
    mini-SWE-agent
    Scaffoldversie
    2.0.0
    Bewijs uit herhaalde uitvoeringen
    Niet gepubliceerd
    Gerapporteerde benchmarkkosten
    US$ 36,64
    Opgelost
    75.8%
Resultaten in één oogopslag
Resultaten in één oogopslagSWE-bench Verified · Taaksucces
  1. Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. Rang 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. Rang 3TRAE + Doubao-Seed-Code78.8%
  4. Rang 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. Rang 5Atlassian Rovo Dev (2025-09-02)76.8%
Gepubliceerde resultatenSWE-bench VerifiedGeverifieerd · Volledige ranglijst · 500 takenHistorisch bewijs
Datum van brongegevensOpgehaald door OpenGPTRangschikking laatst gewijzigdNog geen vergelijkbare geschiedenisOpenGPT controleert deze Agent-bron ten minste eenmaal per week.
BronresultaatOpgelost
Taken500 · door mensen gevalideerde GitHub-issues
BewijsniveauExterne waarschuwing
Bron openen
Bewijsnotitie

Bewaar deze resultaten als Historisch bewijs. Een OpenAI-audit uit 2026 meldde zorgen over het ontwerp en contaminatie in SWE-bench Verified.

Audit openen
Door bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.Valideren vóór ingebruikname

Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt of de configuratie bij uw werk past.

  1. 1

    Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.

  2. 2

    Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.

  3. 3

    Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.

  4. 4

    Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.