AI Agent directory and evaluations

Find verified Agent products, then compare published configurations only within the same benchmark scope.

Evaluation Top 3SWE-bench Verified · Resolved · 10 comparable configurations
  1. Rank 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. Rank 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. Rank 3TRAE + Doubao-Seed-CodeByteDance78.8%

Coding

Choose a task category
Snapshot and changesNo earlier comparable snapshot is stored yet.Current source snapshot
  1. Rank 1
    Base model
    Claude 4.5 Opus medium (20251101)
    Scaffold
    live-SWE-agent
    Repeat-run evidence
    Not published
    Reported benchmark cost
    Not published
    Resolved
    79.2%
  2. Rank 1
    Base model
    Claude 4.5 Opus
    Scaffold
    Sonar Foundation Agent
    Repeat-run evidence
    Not published
    Reported benchmark cost
    Not published
    Resolved
    79.2%
  3. Rank 3
    Base model
    Doubao-Seed-Code + Doubao-Seed-1.6
    Scaffold
    TRAE
    Repeat-run evidence
    Not published
    Reported benchmark cost
    Not published
    Resolved
    78.8%
  4. Rank 4
    Base model
    Gemini 3 Pro Preview (2025-11-18)
    Scaffold
    live-SWE-agent
    Repeat-run evidence
    Not published
    Reported benchmark cost
    Not published
    Resolved
    77.4%
  5. Rank 5
    Base model
    Claude Sonnet 4 + GPT-5
    Scaffold
    Atlassian Rovo Dev
    Scaffold version
    2025-09-02
    Repeat-run evidence
    Not published
    Reported benchmark cost
    Not published
    Resolved
    76.8%
  6. Rank 5
    Base model
    Claude 4 Sonnet
    Scaffold
    EPAM AI/Run Developer Agent
    Scaffold version
    v20250719
    Repeat-run evidence
    Not published
    Reported benchmark cost
    Not published
    Resolved
    76.8%
  7. Rank 5
    Base model
    Claude 4.5 Opus (high reasoning)
    Scaffold
    mini-SWE-agent
    Scaffold version
    2.0.0
    Repeat-run evidence
    Not published
    Reported benchmark cost
    $376.95
    Resolved
    76.8%
  8. Rank 8

    ACoder

    ACoder
    Base model
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Scaffold
    ACoder
    Repeat-run evidence
    Not published
    Reported benchmark cost
    Not published
    Resolved
    76.4%
  9. Rank 9
    Base model
    Gemini 3 Flash (high reasoning)
    Scaffold
    mini-SWE-agent
    Scaffold version
    2.0.0
    Repeat-run evidence
    Not published
    Reported benchmark cost
    $177.98
    Resolved
    75.8%
  10. Rank 9
    Base model
    MiniMax M2.5 (high reasoning)
    Scaffold
    mini-SWE-agent
    Scaffold version
    2.0.0
    Repeat-run evidence
    Not published
    Reported benchmark cost
    $36.64
    Resolved
    75.8%
Results at a glance
Results at a glanceSWE-bench Verified · Task success
  1. Rank 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. Rank 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. Rank 3TRAE + Doubao-Seed-Code78.8%
  4. Rank 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. Rank 5Atlassian Rovo Dev (2025-09-02)76.8%
Published resultsSWE-bench VerifiedVerified · Full leaderboard · 500 tasksHistorical evidence
Source data dateRetrieved by OpenGPTRanking last changedNo comparable history yetOpenGPT checks this Agent source at least once a week.
Source resultResolved
Tasks500 · human-validated GitHub issues
Evidence levelExternal caution
Open source
Evidence note

Keep these results as historical evidence. A 2026 OpenAI audit reported design and contamination concerns in SWE-bench Verified.

Open audit
Source-reported data; missing values remain unknown.Validate before adoption

Public rankings create a shortlist. A small private trial decides whether the configuration fits your work.

  1. 1

    Choose 10–20 representative tasks and define a clear pass condition.

  2. 2

    Lock the agent, model, tools, permissions, and budget before testing.

  3. 3

    Run each important task more than once; record success, cost, time, and takeovers.

  4. 4

    Review failures and data-handling risks before a production decision.