Gecontroleerde bronnen:
AI Agent-directory en -evaluaties
Zoek geverifieerde Agent-producten en vergelijk gepubliceerde configuraties vervolgens alleen binnen hetzelfde benchmarkbereik.
- Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
- Rang 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
- Rang 3TRAE + Doubao-Seed-CodeByteDance78.8%
Overzicht van agentproducten
Over vermeldingen in de gids
Afzonderlijke agentsystemen met een geverifieerde eigen productpagina, documentatiepagina van repository. Opname in de directory verifieert identiteit en een officieel toegangspunt, geen prestaties van aanbeveling. Alleen openbaar bewijs met hetzelfde bereik verschijnt in de ranglijst hieronder.
Geverifieerde producten
66Gecontroleerde bronnen:
Officiële bron
Gecontroleerde bronnen:
Officiële bron
Gecontroleerde bronnen:
Officiële bron
Gecontroleerde bronnen:
Officiële bron
Gecontroleerde bronnen:
Officiële bron
Gecontroleerde bronnen:
Officiële bron
Gecontroleerde bronnen:
Officiële bron
Programmeren
- Rang 1
- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- Niet gepubliceerd
Opgelost79.2%Vermeld door de benchmarkuitgeverBron - Rang 1
- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- Niet gepubliceerd
Opgelost79.2%Vermeld door de benchmarkuitgeverBron - Rang 3
TRAE + Doubao-Seed-Code
ByteDance- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- Niet gepubliceerd
Opgelost78.8%Vermeld door de benchmarkuitgeverBron - Rang 4
- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- Niet gepubliceerd
Opgelost77.4%Vermeld door de benchmarkuitgeverBron - Rang 5
Atlassian Rovo Dev (2025-09-02)
Atlassian- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- Niet gepubliceerd
Opgelost76.8%Vermeld door de benchmarkuitgeverBron - Rang 5
- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- Niet gepubliceerd
Opgelost76.8%Vermeld door de benchmarkuitgeverBron - Rang 5
- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- US$ 376,95
Opgelost76.8%Vermeld door de benchmarkuitgeverBron - Rang 8
ACoder
ACoder- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- Niet gepubliceerd
Opgelost76.4%Vermeld door de benchmarkuitgeverBron - Rang 9
- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- US$ 177,98
Opgelost75.8%Vermeld door de benchmarkuitgeverBron - Rang 9
- Bewijs uit herhaalde uitvoeringen
- Niet gepubliceerd
- Gerapporteerde benchmarkkosten
- US$ 36,64
Opgelost75.8%Vermeld door de benchmarkuitgeverBron
Resultaten in één oogopslag
- Rang 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
- Rang 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
- Rang 3TRAE + Doubao-Seed-Code78.8%
- Rang 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
- Rang 5Atlassian Rovo Dev (2025-09-02)76.8%
Bewijsnotitie
Bewaar deze resultaten als Historisch bewijs. Een OpenAI-audit uit 2026 meldde zorgen over het ontwerp en contaminatie in SWE-bench Verified.
Audit openenDoor bron gerapporteerde gegevens; ontbrekende waarden blijven onbekend.Valideren vóór ingebruikname
Openbare ranglijsten leveren een shortlist op. Een kleine privéproef bepaalt of de configuratie bij uw werk past.
- 1
Kies 10–20 representatieve taken en definieer een duidelijke slaagvoorwaarde.
- 2
Vergrendel de agent, het model, de hulpmiddelen, rechten en het budget voordat u test.
- 3
Voer elke belangrijke taak meerdere keren uit; leg succes, kosten, tijd en overnames vast.
- 4
Beoordeel fouten en risico's bij gegevensverwerking vóór een productiebeslissing.