Scopri come una raccomandazione diventa una decisione.
OpenGPT è uno spazio di lavoro decisionale per l’IA. Mantiene separati la corrispondenza editoriale dei requisiti, i record fattuali delle fonti, la valutazione su attività reali e le evidenze di benchmark pubblicate, affinché ogni risultato possa mostrarne condizioni e limiti.
Il metodo in un minuto
- Una posizione è relativa a una fonte e a un ambito specifici, non è un punteggio universale.
- Le unità di confronto sono le versioni esatte dei modelli e le configurazioni complete degli Agent.
- I dati sconosciuti o incompatibili rimangono tali anziché diventare zero o un’unica classifica combinata.
- I controlli locali dei report dimostrano struttura e coerenza interna, non l’origine degli output o l’autenticità del fornitore.
Punteggi editoriali di idoneità · editorial-fit-v1
Come vengono assegnati i punteggi editoriali di idoneità da 0 a 10
Questi otto segnali del catalogo consentono il confronto categoria per categoria. Costituiscono un livello documentato di valutazione editoriale di OpenGPT, distinto dai punti di raccomandazione rules-v2 e dalle evidenze dei benchmark pubblici.
Punteggio editoriale di idoneità del prodotto: 10 indica una maggiore idoneità alla dimensione specificata; le dimensioni vengono mostrate con pari rilevanza e non sono mai combinate per stabilire un vincitore complessivo.
Intelligenza
0–10Valutazione editoriale dell’idoneità a lavori generici ampi e complessi, basata su funzionalità documentate, ruolo nel catalogo e vincoli noti del prodotto; non è un punteggio di QI o benchmark.
Programmazione
0–10Valutazione editoriale dell’idoneità alla pianificazione, implementazione, correzione degli errori e revisione del software e ai flussi di lavoro dei repository; non è un tasso di superamento misurato.
Ragionamento
0–10Valutazione editoriale dell’idoneità all’analisi in più passaggi, alla gestione dei vincoli e alla risoluzione strutturata dei problemi; non è un benchmark di ragionamento riprodotto.
Scrittura
0–10Valutazione editoriale dell’idoneità ai flussi di redazione, revisione, scrittura di testi lunghi e documentazione; non è un risultato misurato sullo stile o sull’accuratezza fattuale.
Velocità
0–10Valutazione editoriale dell’idoneità a iterazioni reattive, basata sul posizionamento del prodotto e sulla modalità di erogazione; non è una dichiarazione di latenza misurata.
Efficienza dei costi
0–10Valutazione editoriale dell’idoneità al controllo del prezzo di accesso e dei costi operativi, basata sui livelli e sulla modalità di distribuzione indicati; non è un calcolo del costo totale né una garanzia di prezzo.
Controllo della privacy
0–10Valutazione editoriale dell’idoneità al controllo di distribuzione e dati, basata sulla classificazione locale, ibrida o cloud; non è un audit di sicurezza, conformità o telemetria.
Ecosistema
0–10Valutazione editoriale dell’idoneità di strumenti, integrazioni, piattaforme e opzioni di distribuzione disponibili; non è una misurazione della quota di mercato né della qualità delle integrazioni.
Pesi e aggregazione
Ogni dimensione ha la stessa rilevanza visiva. Non esistono pesi aritmetici, medie, punteggi totali o vincitori complessivi; è l’utente a decidere quali dimensioni siano importanti nelle condizioni indicate.
Limite editoriale umano
I redattori assegnano segnali interi di idoneità da 0 a 10 in base alla griglia di valutazione, ai fatti sui prodotti confermati dai fornitori e alle classificazioni del catalogo. Un punteggio non è una misurazione della versione esatta, un risultato di benchmark, una probabilità o una garanzia del fornitore.
Fonti
Le pagine ufficiali dei fornitori supportano identità, accesso, funzionalità pubblicate, opzioni di distribuzione e prezzi di listino. I tag «Ideale per», i punti di forza e debolezza, le classificazioni e tutti i valori da 0 a 10 di OpenGPT sono input editoriali.
Revisione del catalogo
Ultima revisione del catalogo:
Attendibilità: Copertura editoriale media
Il livello di fiducia descrive la completezza della copertura e della spiegazione del catalogo, non la probabilità di prestazioni elevate. Le informazioni dei fornitori possono cambiare e il segnale di idoneità non è stato misurato in modo indipendente.
Applicabilità
Usa i punteggi per confrontare le voci del catalogo secondo la dimensione indicata e le ipotesi attuali sul prodotto e sulla distribuzione. Non interpretare gli scarti di punteggio come differenze misurate delle prestazioni.
Prima dell’adozione, verifica le informazioni aggiornate del fornitore e prova la versione esatta del modello, il livello di servizio, gli strumenti, la regione e un lavoro rappresentativo.
Metodo pubblicato · rules-v2
Come vengono prodotti i consigli di OpenGPT
Il Configuratore trasforma un Profilo locale in un elenco ristretto deterministico. I punti seguenti classificano l’idoneità editoriale dei prodotti dopo rigidi controlli di budget e privacy; non misurano la qualità dei modelli.
Dimensioni del punteggio e punti delle regole additive
I punti sono pesi condizionali, non percentuali. Un criterio vincolante elimina un elemento non idoneo prima della valutazione.
Idoneità all’attività e all’obiettivo
Model · ToolI modelli ricevono +12 per ogni corrispondenza con un’attività selezionata e +10 per una corrispondenza esatta con l’obiettivo. Gli strumenti ricevono +10 per ogni corrispondenza con un caso d’uso selezionato.
User-declared conditions · OpenGPT editorial catalogPrivacy e distribuzione
Model · ToolLa privacy elevata esclude i modelli non locali e gli strumenti non classificati per la privacy elevata. I modelli locali idonei ricevono +30 e gli strumenti ad alta privacy +12. Per una privacy media, i modelli ibridi/locali/cloud ricevono +8/+5/+2.
User-declared conditions · OpenGPT editorial catalogIdoneità al budget
Model · ToolGli elementi che non rientrano nella fascia selezionata dei prezzi indicati vengono esclusi. I modelli idonei ricevono +12 e gli strumenti +8; un modello del profilo gratuito con un’opzione iniziale gratuita indicata riceve altri +16.
User-declared conditions · Provider-published facts · OpenGPT editorial catalogIdoneità al ruolo professionale
Model · ToolLe corrispondenze tra modello e ruolo Studente ricevono +10; le altre corrispondenze supportate tra modello e ruolo +8. Le corrispondenze tra strumento e ruolo Studente ricevono +8; le altre corrispondenze supportate tra strumento e ruolo +6.
User-declared conditions · OpenGPT editorial catalogSegnali del settore
Model · ToolI termini di settore riconosciuti vengono associati alle categorie di attività. I modelli ricevono +5 e gli strumenti +4 per ogni corrispondenza con un’attività associata. Il testo libero non viene copiato nel flusso di lavoro.
User-declared conditions · OpenGPT editorial catalogIdoneità linguistica
ModelloPer una preferenza diversa dall’inglese, una corrispondenza multilingue del catalogo riceve +14 e una mancata corrispondenza −3. Per l’inglese, l’idoneità alla scrittura o alla documentazione riceve +3.
User-declared conditions · OpenGPT editorial catalogIdoneità alla piattaforma
Model · ToolLa corrispondenza del modello vale Web +3, Desktop +10, Terminale +8, API +7 e Dispositivi mobili +9. Gli strumenti ricevono +7 per ogni piattaforma corrispondente o −3 se non vi sono corrispondenze.
User-declared conditions · OpenGPT editorial catalogIdoneità all’esperienza
Model · ToolL’idoneità del modello vale +10 per i principianti (o −4 in caso di mancata corrispondenza con un modello locale), +7 per gli utenti avanzati e +2 per gli utenti intermedi con modelli di frontiera o ibridi. L’idoneità degli strumenti vale rispettivamente +6/+5 per principianti e utenti avanzati.
User-declared conditions · OpenGPT editorial catalogSelezione e pari merito
Model · ToolI candidati idonei vengono ordinati in base ai punti delle regole; a parità di punteggio prevale l’ordine alfabetico. I ruoli vengono assegnati secondo una sequenza fissa e fino a tre ulteriori modelli corrispondenti diventano alternative.
Regole deterministiche v2Fonti e limiti delle affermazioni
Fatti pubblicati dal fornitore
Le pagine ufficiali dei fornitori supportano identità, accesso, descrizioni delle funzionalità pubblicate e prezzi di listino. OpenGPT non considera tali pagine test indipendenti delle prestazioni.
Catalogo editoriale OpenGPT
I tag «Ideale per», i punti di forza, le classificazioni relative a privacy e distribuzione e i segnali di idoneità del prodotto sono valutazioni editoriali sottoposte a revisione. Non sono misurazioni di benchmark né garanzie dei fornitori.
Condizioni dichiarate dall’utente
I segnali relativi a obiettivo, attività, ruolo, budget, privacy, lingua, piattaforma, competenze e settore provengono dal profilo locale dell’utente. Descrivono l’applicabilità, non evidenze esterne.
Regole deterministiche v2
Lo stesso profilo normalizzato e la stessa istantanea del catalogo producono lo stesso ordine. Il calcolo è spiegabile, ma il determinismo non rende oggettivi gli input editoriali.
Contesto del benchmark pubblico
Le classifiche pubbliche restano evidenze separate. rules-v2 non aggiunge posizioni o punteggi di benchmark ai punti dei consigli; usali dopo aver creato la rosa di candidati e preserva l’ambito di ogni fonte.
Fattuale ed editoriale
Le dichiarazioni fattuali devono essere riconducibili a un fornitore o a una fonte di benchmark identificati, a un’identità esatta quando disponibile e a una data di revisione.
Tag di idoneità, punti di forza, classificazioni, ipotesi, livello di fiducia e consigli sono valutazioni editoriali di OpenGPT. Non devono essere presentati come risultati misurati di versioni esatte.
Cadenza e attendibilità della revisione
La metodologia e i record dei consigli attivi sono sottoposti a revisione programmata almeno ogni 90 giorni, oltre che in base agli eventi. Ogni risultato deve usare la data di revisione del proprio record, non quella di questa pagina.
La revisione viene attivata quando
- Un fornitore modifica l’ID, il ciclo di vita, il percorso di accesso, una dichiarazione sulle funzionalità o il prezzo indicato di un modello.
- Cambiano il motore di raccomandazione, i pesi, i criteri rigidi o la tassonomia editoriale.
- Una correzione identifica un errore sostanziale relativo a fonte, identità, prezzo, privacy o applicabilità.
Regole del livello di fiducia
Il livello di fiducia descrive la completezza della spiegazione dell’idoneità e del relativo record di supporto. Non esprime la probabilità che il modello funzioni bene.
- Alto
- Sono presenti l’identità esatta e una fonte fattuale Attuale; i campi rilevanti sono risolti, le ipotesi sono visibili ed è indicata un’alternativa idonea.
- Medio
- La corrispondenza è spiegabile, ma una fonte, una condizione o un fatto attuale richiede conferma prima dell’adozione.
- Basso
- L’identità, l’attualità, i prezzi, la privacy o l’applicabilità presentano una lacuna sostanziale. Considera l’elemento soltanto un candidato da esaminare.
Applicabilità e condizioni
- Si applica alla rosa editoriale rules-v2 generata dall’attuale catalogo verificato di modelli e strumenti.
- Il risultato dipende dal profilo inviato e dall’istantanea del catalogo; modificando uno dei due, il risultato può cambiare.
- È un ausilio decisionale a basso rischio, non una prova di qualità, prezzo in tempo reale, primato nei benchmark, sicurezza, legalità o idoneità a un uso regolamentato.
Visualizzazione di controllo obbligatoria per ogni risultato
Una raccomandazione integrata deve mostrare tutti e sette i campi seguenti senza richiedere all’utente di dedurre i limiti delle evidenze.
- Perché
- Evidenze
- Ipotesi
- Ultima revisione
- Attendibilità
- Migliore alternativa
- Quando non scegliere
Da un’attività reale a una conclusione verificabile
Definisci il test
Prima del confronto, registra l’attività, i criteri di successo, gli input, i vincoli, le versioni esatte dei modelli, le impostazioni e la data.
Usa le stesse condizioni
Assegna a ogni candidato la stessa attività e la stessa griglia di valutazione. Le etichette nascoste riducono la distorsione dovuta ai nomi visibili, ma non si tratta di un test in doppio cieco o condotto in modo indipendente.
Mantieni i dati della fonte
Salva prompt, risposte, punteggi, errori, latenza e hash. Non colmare con stime le evidenze mancanti.
Indica i limiti
Mostra incertezza, dimensione del campione, esclusioni, conflitti e ciò che il risultato non dimostra.
Livelli delle evidenze
Evidence v1/v2 controlla il formato del file e la coerenza dichiarata. Lo Spazio di lavoro decisionale V3 ricalcola inoltre hash, assegnazioni, associazioni, punteggi e riepiloghi a partire dagli input salvati. Non dimostra una riproduzione indipendente al livello L4.
Formato controllato
Il file rispetta lo schema dichiarato e non contiene campi riservati evidenti.
Record completo
L’obiettivo è un registro coerente di attività, impostazioni, dichiarazioni dei modelli e data di valutazione. La versione 1 controlla solo una parte di questo registro.
Ricalcolabile
Lo Spazio di lavoro decisionale V3 include gli output non elaborati incollati e gli input di valutazione per un rigoroso ricalcolo locale; Evidence v1/v2 non contiene gli stessi campi.
Riprodotto in modo indipendente
Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.
Come si confrontano le classifiche degli Agent di IA
Ogni riga rappresenta una configurazione di Agent pubblicata in un ambito di benchmark specifico. Non è un punteggio riferito al solo modello di base.
Confronta le configurazioni di sistema
Mantieni insieme tutti i campi relativi ad Agent, modello di base, scaffold, strumento, ambiente, budget e data pubblicati dalla fonte; contrassegna come sconosciuti i campi non riportati.
Preserva le scale originali
Classifica soltanto all’interno dello stesso benchmark, versione, regole delle attività e gruppo di esecuzioni comparabili. OpenGPT non crea un punteggio universale tra benchmark diversi.
Indica lo stato delle evidenze
Distingui i record elencati dal publisher di un benchmark, gli invii controllati a monte, i report dei fornitori e le esecuzioni della community.
Conserva le evidenze operative
Mostra costo, latenza, passaggi e intervento umano quando la fonte fornisce valori confrontabili; lascia i valori mancanti come sconosciuti.
Cosa può stabilire la convalida locale
- ✓Campi obbligatori e tipi di dati supportati
- ✓Coerenza interna di punteggi, esecuzioni, date e hash
- ✓Se il pacchetto dichiara dati dimostrativi
- ✓Assenza di campi comuni per chiavi API e segreti
Cosa non può stabilire da solo
- —Che il fornitore o il modello dichiarato abbia effettivamente prodotto l’output
- —Che un punteggio sia privo di distorsioni di selezione o di una progettazione carente dei test
- —Che un risultato si applichi a ogni attività, lingua, utente o versione futura del modello
- —Che un modello sia sicuro, legale o appropriato per una decisione ad alto rischio
Principi di pubblicazione
Nessun pagamento per entrare in classifica
Le sponsorizzazioni possono essere dichiarate, ma non possono modificare i punteggi, i criteri di ammissione delle evidenze o il posizionamento.
Versioni, non nomi dei marchi
Una serie di modelli non è un oggetto di prova stabile. Sono importanti gli ID esatti dei modelli, le impostazioni, la regione e la data.
Attività reali prima di affermazioni generali
OpenGPT consiglia rose di candidati in base ai requisiti, quindi chiede agli utenti di testare il proprio lavoro rappresentativo.
L’incertezza è un risultato
Pari merito, campioni piccoli, esecuzioni non riuscite ed evidenze non conclusive devono rimanere visibili.