Configurazione dell’Agent · SWE-bench Verified
mini-SWE-agent + Claude 4.5 Opus (high reasoning)
L’oggetto classificato: modello, scaffold, strumenti, autorizzazioni, budget e ambiente nel loro insieme.
01
Configurazione
02
Esito
03
Operazione
04
Attendibilità
Nota sulle evidenze
Conserva questi risultati come evidenze Storiche. Un audit di OpenAI del 2026 ha segnalato problemi di progettazione e contaminazione in SWE-bench Verified.
Apri l’audit ↗Cosa non dimostra questo risultato
Questo risultato si applica alle condizioni esatte del sistema e della fonte qui indicate. Non stabilisce quale sia il miglior agente in assoluto, né l’affidabilità in produzione, la governance dei dati o le prestazioni su una versione diversa del benchmark.
Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.
Convalida prima dell’adozione
Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.
- 1
Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.
- 2
Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.
- 3
Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.
- 4
Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.