Fonti verificate:
Directory e valutazioni degli Agent di AI
Trova prodotti Agent verificati, quindi confronta le configurazioni pubblicate soltanto nello stesso ambito di benchmark.
- Posizione 1live-SWE-agent + Claude 4.5 Opus medium (20251101)UIUC79.2%
- Posizione 1Sonar Foundation Agent + Claude 4.5 OpusSonar79.2%
- Posizione 3TRAE + Doubao-Seed-CodeByteDance78.8%
Directory dei prodotti Agent
Informazioni sulle voci della directory
Sistemi Agent distinti con pagina del prodotto, pagina della documentazione o repository verificati e gestiti direttamente dal produttore. L’inclusione nella directory verifica l’identità e un punto di accesso ufficiale, non le prestazioni né un consiglio. Nella classifica sottostante compaiono solo evidenze pubbliche dello stesso ambito.
Prodotti verificati
66Fonti verificate:
Fonte ufficiale
Fonti verificate:
Fonte ufficiale
Fonti verificate:
Fonte ufficiale
Fonti verificate:
Fonte ufficiale
Fonti verificate:
Fonte ufficiale
Fonti verificate:
Fonte ufficiale
Fonti verificate:
Fonte ufficiale
Programmazione
- Posizione 1
- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- Non pubblicato
Risolto79.2%Elencato dal publisher del benchmarkFonte - Posizione 1
- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- Non pubblicato
Risolto79.2%Elencato dal publisher del benchmarkFonte - Posizione 3
TRAE + Doubao-Seed-Code
ByteDance- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- Non pubblicato
Risolto78.8%Elencato dal publisher del benchmarkFonte - Posizione 4
- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- Non pubblicato
Risolto77.4%Elencato dal publisher del benchmarkFonte - Posizione 5
Atlassian Rovo Dev (2025-09-02)
Atlassian- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- Non pubblicato
Risolto76.8%Elencato dal publisher del benchmarkFonte - Posizione 5
- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- Non pubblicato
Risolto76.8%Elencato dal publisher del benchmarkFonte - Posizione 5
- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- 376,95 USD
Risolto76.8%Elencato dal publisher del benchmarkFonte - Posizione 8
ACoder
ACoder- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- Non pubblicato
Risolto76.4%Elencato dal publisher del benchmarkFonte - Posizione 9
- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- 177,98 USD
Risolto75.8%Elencato dal publisher del benchmarkFonte - Posizione 9
- Evidenze delle esecuzioni ripetute
- Non pubblicato
- Costo di benchmark indicato
- 36,64 USD
Risolto75.8%Elencato dal publisher del benchmarkFonte
I risultati in sintesi
- Posizione 1live-SWE-agent + Claude 4.5 Opus medium (20251101)79.2%
- Posizione 1Sonar Foundation Agent + Claude 4.5 Opus79.2%
- Posizione 3TRAE + Doubao-Seed-Code78.8%
- Posizione 4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18)77.4%
- Posizione 5Atlassian Rovo Dev (2025-09-02)76.8%
Nota sulle evidenze
Conserva questi risultati come evidenze Storiche. Un audit di OpenAI del 2026 ha segnalato problemi di progettazione e contaminazione in SWE-bench Verified.
Apri l’auditDati riportati dalla fonte; i valori mancanti rimangono sconosciuti.Convalida prima dell’adozione
Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.
- 1
Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.
- 2
Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.
- 3
Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.
- 4
Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.