Directory e valutazioni degli Agent di AI

Trova prodotti Agent verificati, quindi confronta le configurazioni pubblicate soltanto nello stesso ambito di benchmark.

Prime 3 della valutazioneSWE-bench Verified · Risolto · 10 configurazioni comparabili
  1. Posizione 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
  2. Posizione 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
  3. Posizione 3TRAE + Doubao-Seed-CodeByteDance78.8%

Programmazione

Scegli una categoria di attività
Istantanea e modificheNon è ancora archiviata alcuna istantanea precedente comparabile.Istantanea Attuale della fonte
  1. Posizione 1
    Modello di base
    Claude 4.5 Opus medium (20251101)
    Scaffold
    live-SWE-agent
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    Non pubblicato
    Risolto
    79.2%
  2. Posizione 1
    Modello di base
    Claude 4.5 Opus
    Scaffold
    Sonar Foundation Agent
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    Non pubblicato
    Risolto
    79.2%
  3. Posizione 3
    Modello di base
    Doubao-Seed-Code + Doubao-Seed-1.6
    Scaffold
    TRAE
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    Non pubblicato
    Risolto
    78.8%
  4. Posizione 4
    Modello di base
    Gemini 3 Pro Preview (2025-11-18)
    Scaffold
    live-SWE-agent
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    Non pubblicato
    Risolto
    77.4%
  5. Posizione 5
    Modello di base
    Claude Sonnet 4 + GPT-5
    Scaffold
    Atlassian Rovo Dev
    Versione dello scaffold
    2025-09-02
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    Non pubblicato
    Risolto
    76.8%
  6. Posizione 5
    Modello di base
    Claude 4 Sonnet
    Scaffold
    EPAM AI/Run Developer Agent
    Versione dello scaffold
    v20250719
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    Non pubblicato
    Risolto
    76.8%
  7. Posizione 5
    Modello di base
    Claude 4.5 Opus (high reasoning)
    Scaffold
    mini-SWE-agent
    Versione dello scaffold
    2.0.0
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    376,95 USD
    Risolto
    76.8%
  8. Posizione 8

    ACoder

    ACoder
    Modello di base
    Claude 4 Sonnet + Claude 4.1 Opus + GPT-5 + Gemini 2.5 Pro
    Scaffold
    ACoder
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    Non pubblicato
    Risolto
    76.4%
  9. Posizione 9
    Modello di base
    Gemini 3 Flash (high reasoning)
    Scaffold
    mini-SWE-agent
    Versione dello scaffold
    2.0.0
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    177,98 USD
    Risolto
    75.8%
  10. Posizione 9
    Modello di base
    MiniMax M2.5 (high reasoning)
    Scaffold
    mini-SWE-agent
    Versione dello scaffold
    2.0.0
    Evidenze delle esecuzioni ripetute
    Non pubblicato
    Costo di benchmark indicato
    36,64 USD
    Risolto
    75.8%
I risultati in sintesi
I risultati in sintesiSWE-bench Verified · Esito positivo dell’attività
  1. Posizione 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
  2. Posizione 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
  3. Posizione 3TRAE + Doubao-Seed-Code78.8%
  4. Posizione 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
  5. Posizione 5Atlassian Rovo Dev (2025-09-02)76.8%
Risultati pubblicatiSWE-bench VerifiedVerificato · Classifica completa · 500 attivitàEvidenza Storica
Data dei dati della fonteRecuperato da OpenGPTUltima modifica della classificaAncora nessuna cronologia comparabileOpenGPT controlla questa fonte dell’Agent almeno una volta alla settimana.
Risultato della fonteRisolto
Attività500 · issue GitHub convalidate da persone
Livello delle evidenzeAvvertenza esterna
Apri la fonte
Nota sulle evidenze

Conserva questi risultati come evidenze Storiche. Un audit di OpenAI del 2026 ha segnalato problemi di progettazione e contaminazione in SWE-bench Verified.

Apri l’audit
Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.Convalida prima dell’adozione

Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.

  1. 1

    Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.

  2. 2

    Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.

  3. 3

    Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.

  4. 4

    Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.