GUIDE E ASSISTENZA

Centro assistenza OpenGPT

Trova il flusso di lavoro giusto, segui ogni passaggio e comprendi cosa può e non può dirti il risultato.

Inizia da ciò che vuoi fare

Ogni flusso di lavoro risponde a una domanda diversa. Parti dall’obiettivo più vicino, quindi segui la guida collegata.

1Classifiche dei modelliComprendi i segnali pubblicati e lo stato dell’identità.2Classifiche degli AgentScegli configurazioni complete degli Agent in base all’attività e alle evidenze.3ScegliRestringi i candidati in base a requisiti reali.4Confronta i dati pubbliciAffianca da due a quattro ID modello del catalogo.5Salva i modelliMantieni una rosa locale di candidati in questo browser.6Esegui una prova in Proof LabTesta 2–4 configurazioni esatte di modelli o Agent su un unico Pacchetto di attività bloccato.7Invia o correggi le evidenzeInvia una fonte pubblica relativa a un modello o Agent per la revisione editoriale.8Verifica un reportVerifica localmente un report JSON di OpenGPT prima di condividerlo.

01

Classifiche dei modelli di AI

Scopri cosa viene classificato, da dove provengono i dati e quali registri includono un ID ufficiale del modello.

Aperto

A cosa serve questa funzionalità

Usa ogni prospettiva di classifica per esaminare i segnali pubblicati, verificare i registri delle fonti e creare un elenco ristretto per i test su attività reali.

Prima di iniziare

Inizia dalla domanda a cui devi rispondere. Le classifiche relative a preferenze degli utenti, capacità complessive, attività oggettive, costi e pesi aperti utilizzano fonti e scale diverse.

Tutorial dettagliato

  1. 1Scegli la prospettiva di classifica più adatta alla tua decisione.
  2. 2Usa Classifica completa della fonte per ogni registro dell’editore oppure ID ufficiali dei modelli per i registri collegati dalla documentazione del fornitore.
  3. 3Leggi insieme posizione nella fonte, intervallo del punteggio, voti, licenza e configurazione.
  4. 4Apri Dettagli del modello su una riga qualsiasi. Le associazioni ufficiali esatte usano il profilo ufficiale; ogni altra riga apre un profilo di origine che conserva il nome e la configurazione pubblicati.
  5. 5Aggiungi una riga qualsiasi al confronto. Le associazioni esatte e sicure a livello di configurazione usano il confronto delle versioni ufficiali; tutte le altre righe usano il confronto dei record di origine all’interno della stessa fonte, dimensione e istantanea.

Come leggere il risultato

Una posizione è relativa a una fonte e a un ambito. I pareggi possono far saltare i numeri delle posizioni e i punteggi ottenuti da prospettive di classifica diverse non sono direttamente confrontabili.

Cosa non può dimostrare

OpenGPT organizza dati pubblici di terze parti e non ha ripetuto queste valutazioni. Nessuna classifica identifica il modello migliore per ogni utente o attività.

Domanda frequente: Perché alcune righe mostrano soltanto l’ID del modello o il nome della fonte?

Ora ogni riga contiene i dettagli del modello e un’azione di confronto. OpenGPT aggiunge un ID modello ufficiale soltanto quando la documentazione del fornitore dimostra l’associazione esatta; in caso contrario, il confronto dei record di origine conserva il nome del publisher, la configurazione e i dati di classifica senza inventare un nuovo ID ufficiale.

Torna all’inizio
02

Classifiche degli Agent di AI

Scegli un Agent in base all’attività, alla configurazione completa, alla qualità delle evidenze e ai risultati comparabili.

Aperto

A cosa serve questa funzionalità

Esplora 96 configurazioni pubblicate di valutazione degli Agent in sette ambiti di attività, oltre a 109 risultati BFCL separati di modelli per l’uso degli strumenti, senza trasformare evidenze incompatibili in un unico punteggio.

Prima di iniziare

Il risultato di un agente appartiene a una configurazione completa: modello di base, scaffold, strumenti, autorizzazioni, budget, ambiente, versione del benchmark e data. OpenGPT conserva i campi riportati dalla fonte e lascia quelli mancanti non dichiarati, invece di considerarli pari a zero.

Tutorial dettagliato

  1. 1Scegli la categoria di attività più adatta al tuo lavoro.
  2. 2Prima di leggere la posizione, verifica l’ambito e la versione del benchmark, la data della valutazione, l’attualità e la nota di audit.
  3. 3Usa il grado delle evidenze per distinguere i risultati riprodotti o verificati dalle esecuzioni pubbliche trasparenti e dai risultati riportati dai fornitori.
  4. 4Confronta successo, evidenze delle esecuzioni ripetute, durata e intervento soltanto quando la fonte li riporta nelle stesse condizioni. OpenGPT mostra il costo per successo solo quando il totale pubblicato e il denominatore di attività o esecuzioni usano lo stesso ambito verificato.
  5. 5Segui le configurazioni utili, esaminane la cronologia e seleziona da due a quattro voci dello stesso gruppo comparabile per una vista affiancata.

Come leggere il risultato

Una posizione descrive una configurazione completa del sistema nell’ambito di un benchmark. Interpretala considerando il livello di evidenza, l’attualità, il numero di campioni o esecuzioni e gli eventuali campi relativi a costi e affidabilità.

Cosa non può dimostrare

OpenGPT non crea un punteggio universale degli Agent. Salvo quando un risultato è contrassegnato esplicitamente come riprodotto, OpenGPT organizza evidenze a monte anziché ripetere la valutazione; nessun benchmark dimostra l’idoneità alla produzione per ogni flusso di lavoro.

Domanda frequente: Perché lo stesso agente o modello può comparire più di una volta?

Uno scaffold, una versione del modello, un insieme di strumenti, un livello di autorizzazione, un budget o un’impostazione del benchmark diversi creano una configurazione dell’agente distinta che deve rimanere un record separato.

Torna all’inizio
03

Invia un modello o un Agent

Invia per la revisione un registro pubblico di identità o evidenze senza modificare le classifiche.

Aperto

A cosa serve questa funzionalità

Usa il flusso di invio quando manca un ID ufficiale del modello o un prodotto Agent oppure quando una fonte pubblica richiede una revisione editoriale.

Prima di iniziare

Accedi con un account verificato e prepara una fonte HTTPS pubblica. Non inviare mai credenziali, file privati o informazioni personali.

Tutorial dettagliato

  1. 1Scegli Modello o Agent nella parte superiore del modulo.
  2. 2Inserisci il nome pubblico esatto, il fornitore o l’organizzazione e i campi dell’identità richiesti.
  3. 3Scegli il tipo di fonte e inserisci un link alla documentazione ufficiale, a un repository pubblico o a un risultato pubblico di benchmark.
  4. 4Spiega cosa dovrebbe verificare il revisore, quindi esegui un solo invio.
  5. 5Monitora lo stato della revisione nei tuoi invii recenti. Un prodotto Agent approvato viene inserito automaticamente nella directory consultabile degli Agent; la classificazione rimane distinta.

Come leggere il risultato

Un invio riuscito riceve un numero di riferimento ed entra nella coda di revisione. Un prodotto Agent approvato è un record della directory pubblica, non una posizione in classifica né un’approvazione di OpenGPT.

Cosa non può dimostrare

Gli autori degli invii non possono impostare posizione, grado delle evidenze, comparabilità o stato della pubblicazione. I limiti sui duplicati e sulla frequenza riducono gli abusi e l’approvazione non modifica mai automaticamente una classifica.

Domanda frequente: Perché un invio approvato non è stato aggiunto alla classifica?

I prodotti Agent approvati sono ricercabili nella directory, ma per una classifica servono comunque evidenze pubbliche di valutazione comparabili.

Torna all’inizio
04

Modifiche alla classifica e cronologia delle versioni

Monitora i movimenti tra istantanee confrontabili e confronta gli ID dei modelli a catalogo.

Aperto

A cosa serve questa funzionalità

Usa questa pagina per vedere cosa è cambiato rispetto all’istantanea precedente della fonte, quali registri sono apparsi per la prima volta, in che modo differiscono le versioni esatte e quando sono stati recuperati i dati.

Prima di iniziare

Le variazioni Storiche usano attualmente l’ambito delle preferenze degli utenti di LMArena. Le altre fonti attive restano limitate ai dati Attuali finché non esiste un’istantanea precedente comparabile.

Tutorial dettagliato

  1. 1Controlla la data della fonte, lo stato di riferimento del confronto, la data di acquisizione e la regola di confronto.
  2. 2Considera le crescite più rapide soltanto tra i record presenti in entrambe le istantanee.
  3. 3Considera Prima comparsa come una nuova voce della fonte, non come una data ufficiale di rilascio.
  4. 4Filtra la tabella delle variazioni per saliti, scesi, invariati, comparsi per la prima volta o non più presenti.
  5. 5Confronta due ID modello del catalogo, quindi scarica un’istantanea della fonte quando ti serve una traccia di audit.

Come leggere il risultato

OpenGPT calcola le variazioni soltanto quando fonte, ambito, unità e metodo corrispondono e conserva istantanee mensili scaricabili.

Cosa non può dimostrare

Soltanto le date di rilascio documentate dal fornitore sono considerate versioni del prodotto. Il confronto tra versioni non deduce velocità, prezzo, lunghezza del contesto o qualità dai nomi.

Domanda frequente: Perché LiveBench non mostra variazioni di posizione?

OpenGPT non ha fissato un’edizione precedente comparabile per questa fonte attiva. Le fonti in pausa restano Storiche anziché contribuire alle variazioni Attuali.

Torna all’inizio
05

Classifiche per attività

Parti da uno scenario di lavoro reale ed esamina tre versioni ufficiali dei modelli che vale la pena testare per prime.

Aperto

A cosa serve questa funzionalità

Usa le classifiche delle attività per trasformare ampi segnali pubblici in un elenco ristretto, pratico e contenuto per programmazione, ricerca, documenti, assistenza, lavoro multilingue, lavoro multimodale, costo, privacy o velocità.

Prima di iniziare

Scegli l’attività più vicina al tuo lavoro, quindi annota i prompt, i dati, gli strumenti, la regione, il budget e i requisiti di privacy effettivi. Le evidenze pubbliche mostrate possono riguardare un ambito più ampio rispetto alla tua attività.

Tutorial dettagliato

  1. 1Apri lo scenario di attività più vicino alla decisione che devi prendere.
  2. 2Leggi perché sono state selezionate le tre versioni ufficiali e cosa resta incerto.
  3. 3Esamina la fonte pubblica, la posizione o il valore nella fonte, la data di revisione dell’associazione e la data limite dei dati per ogni candidato.
  4. 4Seleziona due o tre candidati per un confronto affiancato dei dati pubblici.
  5. 5Apri la valutazione su attività reali con i primi due candidati, modifica l’insieme di attività di esempio e provali entrambi con impostazioni comparabili.

Come leggere il risultato

Ottieni tre candidati iniziali ufficiali, evidenze pubbliche visibili quando disponibili e percorsi diretti per confrontarli o eseguire un test su un’attività reale.

Cosa non può dimostrare

Una classifica per attività è una rosa iniziale di candidati, non una classifica universale né la prova del modello migliore. L’assenza di evidenze non equivale a zero e fonti pubbliche diverse non vengono combinate in un unico punteggio.

Domanda frequente: Perché un candidato iniziale può non avere risultati pubblici confrontabili?

Una versione ufficiale può essere pertinente all’attività per il posizionamento del prodotto o il tipo di distribuzione anche quando nessun risultato della versione esatta è associato alla fonte pubblica selezionata. L’evidenza mancante rimane visibile e deve essere risolta con un test proprio.

Torna all’inizio
06

Radar di aggiornamento dei modelli

Imposta i modelli che utilizzi, il lavoro ricorrente e le priorità, quindi esamina segnali prudenti per capire quando vale la pena effettuare un confronto equo.

Aperto

A cosa serve questa funzionalità

Usa il radar per rispondere a una domanda pratica: esistono evidenze pubbliche confrontabili sufficienti per testare un’alternativa al modello che utilizzi ora?

Prima di iniziare

Scegli le versioni ufficiali esatte, almeno un’attività ricorrente e fino a due priorità. Usa lo stesso browser e lo stesso dispositivo, perché la configurazione resta locale.

Tutorial dettagliato

  1. 1Scegli le versioni ufficiali esatte che usi attualmente; non si presume che i modelli salvati siano Attuali.
  2. 2Seleziona le attività ricorrenti e fino a due priorità, come qualità, costo, velocità, privacy o contesto esteso.
  3. 3Valuta se conviene confrontare ciascun modello, se è opportuno continuare a monitorarlo o se si avvicina al ritiro.
  4. 4Esamina evidenze pubbliche comparabili, quindi prova entrambi i modelli sullo stesso lavoro reale.
  5. 5Esamina le modifiche settimanali o abbonati al feed RSS pubblico sulle variazioni delle classifiche.

Come leggere il risultato

Il radar crea un controllo degli aggiornamenti locale sul dispositivo con il modello attuale, un’alternativa adatta all’attività quando disponibile, la data delle evidenze, i limiti di incertezza e azioni di confronto diretto.

Cosa non può dimostrare

Un controllo dell’aggiornamento non è un’istruzione a cambiare. Costi, velocità, privacy o contesto possono comunque richiedere test diretti e le impostazioni locali non vengono sincronizzate né incluse nel backup.

Domanda frequente: «Vale la pena confrontarlo» significa che dovrei sostituire il mio modello attuale?

No. Significa che un segnale comparabile o una modifica del ciclo di vita rende utile un test sulla stessa attività. Cambia soltanto dopo che l’alternativa ha avuto successo sul tuo lavoro reale e con i tuoi vincoli.

Torna all’inizio
07

Scegli un modello di IA

Trasforma quattro requisiti pratici in un elenco ristretto spiegabile.

Aperto

A cosa serve questa funzionalità

Usa lo strumento di ricerca quando sai quale lavoro devi svolgere, ma non quale serie di modelli esaminare per prima.

Prima di iniziare

Individua l’attività principale, dove può essere eseguito il modello, la priorità operativa più importante e gli eventuali requisiti linguistici.

Tutorial dettagliato

  1. 1Scegli l’attività più simile al tuo lavoro reale.
  2. 2Imposta il limite di distribuzione, soprattutto quando i dati non possono lasciare il tuo ambiente.
  3. 3Scegli la priorità su cui sei meno disposto a scendere a compromessi.
  4. 4Imposta il requisito linguistico, quindi esamina per ciascun candidato i motivi della corrispondenza, i rischi e il passaggio successivo della convalida.
  5. 5Porta i candidati più validi alla valutazione su attività reali e testa versioni esatte dei modelli sulle stesse attività.

Come leggere il risultato

L’etichetta qualitativa e il conteggio delle corrispondenze ai requisiti si applicano alla serie di modelli, non alle singole versioni; nessuno dei due è un punteggio di benchmark. Verifica la disponibilità di distribuzione di ogni versione attuale elencata e confronta i candidati sulle stesse attività.

Cosa non può dimostrare

Lo strumento di ricerca non chiama modelli, non verifica i prezzi attuali e non indica un vincitore universale. Una serie di modelli può includere versioni con capacità diverse.

Domanda frequente: Perché un modello famoso non è comparso al primo posto?

L’ordine riflette i vincoli selezionati, non la popolarità generale. Modifica un requisito per scoprire cosa ha determinato il risultato, quindi testa versioni esatte.

Torna all’inizio
08

Directory e dettagli dei modelli

Esplora gli ID modello documentati dai fornitori, apri le pagine dei dettagli dedicate e verifica se esistono dati pubblici di classifica comparabili.

Aperto

A cosa serve questa funzionalità

Usa la directory quando ti servono l’ID ufficiale esatto di un modello, la destinazione del fornitore, le attività adatte e non adatte, le fonti e uno stato chiaro dei dati della classifica.

Prima di iniziare

Inserisci il nome di un modello o di un fornitore, un requisito di distribuzione oppure un’attività. Un ID modello documentato dal fornitore non garantisce dati pubblici di valutazione comparabili.

Tutorial dettagliato

  1. 1Cerca per modello, versione, fornitore o attività.
  2. 2Filtra per metodo di distribuzione e per stato classificato o attualmente non classificato.
  3. 3Apri la pagina dei dettagli di un modello per esaminare identità, uso previsto, copertura dei dati pubblici, punti di forza, limitazioni, fonti e data di revisione.
  4. 4Usa la destinazione ufficiale per verificare disponibilità attuale, prezzi, privacy e limiti.
  5. 5Aggiungi da due a quattro versioni del catalogo al confronto dei dati, quindi porta due finalisti alla valutazione su attività reali.

Come leggere il risultato

Classificato significa che a quell’ID modello esatto sono collegati dati comparabili pubblicati. Non classificato significa che questa edizione non dispone di un record comparabile adeguato; non equivale a un punteggio zero.

Cosa non può dimostrare

La documentazione del fornitore attesta l’identità nel catalogo, non la disponibilità Attuale in ogni Paese o livello di servizio. La copertura della classifica, i dettagli dei modelli e le condizioni dei fornitori possono cambiare dopo la data di revisione.

Domanda frequente: Non classificato significa che il modello è debole?

No. Significa che questa edizione non dispone di dati pubblici comparabili adatti per quell’ID modello. Provalo direttamente se resta pertinente alla tua decisione.

Torna all’inizio
09

Confronto dei dati

Confronta da due a quattro versioni ufficiali esatte oppure record di un’unica vista di classifica pubblicata.

Aperto

A cosa serve questa funzionalità

Il confronto tra versioni ufficiali organizza gli ID documentati dai fornitori nelle fonti pubblicate. Il confronto tra record di origine conserva il nome e le impostazioni del publisher quando un confronto ufficiale esatto comporterebbe una perdita di informazioni.

Prima di iniziare

Per le versioni ufficiali, scegli da due a quattro ID del catalogo. Per i record di origine, scegli da due a quattro righe della stessa fonte, dimensione e istantanea.

Tutorial dettagliato

  1. 1Aggiungi una riga qualsiasi da una classifica. Le associazioni sicure a livello di configurazione usano il confronto delle versioni ufficiali; tutte le altre righe usano il confronto dei record di origine.
  2. 2I risultati ufficiali restano separati per fonte e dimensione.
  3. 3I risultati dei registri delle fonti conservano nome, impostazioni, posizione e punteggio pubblicati su un’unica scala comune della fonte.
  4. 4I dati mancanti restano sconosciuti anziché essere considerati pari a zero.
  5. 5Solo le versioni ufficiali esatte possono passare alla valutazione su attività reali dopo che hai scelto due finalisti.

Come leggere il risultato

Il confronto crea un elenco ristretto consapevole delle evidenze e mostra dove mancano informazioni. Non produce un nuovo punteggio di benchmark né decreta un vincitore universale.

Cosa non può dimostrare

OpenGPT non chiama i modelli in questa vista. I punteggi pubblicati provenienti da fonti o ambiti diversi non sono intercambiabili e i dettagli dei modelli possono cambiare dopo la data di revisione.

Domanda frequente: In cosa differisce il confronto dei dati dalla valutazione su attività reali?

Il confronto dei dati riassume le informazioni già pubblicate per un numero di modelli compreso tra due e quattro. La valutazione su attività reali accetta esattamente due versioni, ti chiede di eseguire gli stessi prompt in entrambi i servizi ed esamina le risposte incollate nascondendo le etichette visibili dei modelli.

Torna all’inizio
10

I miei modelli

Mantieni un piccolo elenco di lavoro delle voci in classifica in questo browser.

Aperto

A cosa serve questa funzionalità

Usa Modelli salvati per tornare rapidamente ai candidati, aprire destinazioni attendibili e inserire in un confronto gli ID dei modelli supportati.

Prima di iniziare

Usa lo stesso browser e dispositivo. L’elenco è archiviato localmente, senza account OpenGPT né sincronizzazione nel cloud.

Tutorial dettagliato

  1. 1Seleziona Salva in una riga qualsiasi della classifica.
  2. 2Apri Modelli salvati dalla barra di navigazione superiore per esaminare le voci salvate.
  3. 3Ogni record di origine salvato mostra il relativo ID modello o nome nella fonte. I record con un ID modello ufficiale possono anche aprire la destinazione del fornitore o entrare nel confronto.
  4. 4Aggiungi due ID di modelli supportati diversi, quindi apri il confronto dei dati pubblici. Scegli lì due finalisti prima di avviare una valutazione su attività reali.
  5. 5Rimuovi le voci che non ti servono più. L’aggiornamento della pagina o il cambio della lingua del sito mantiene l’elenco nello stesso browser.

Come leggere il risultato

Il conteggio accanto a Modelli salvati indica quante voci sono state salvate. L’identità della fonte e quella ufficiale del modello rimangono distinte.

Cosa non può dimostrare

L’elenco non è un account né una sincronizzazione dei segnalibri o un backup. Non sarà visibile in un altro browser o dispositivo e la navigazione privata, le limitazioni dello spazio di archiviazione o la cancellazione dei dati del sito possono rimuoverlo.

Domanda frequente: Perché i modelli salvati sono scomparsi?

Verifica di usare lo stesso profilo del browser e lo stesso dispositivo. Se lo spazio di archiviazione del sito è stato cancellato o bloccato, OpenGPT non può ripristinare l’elenco locale.

Torna all’inizio
11

Proof Lab

Esegui una prova privata su un lavoro reale; in modalità temporanea, gli output grezzi restano in memoria a meno che tu non scelga esplicitamente di conservarli su questo dispositivo.

Aperto

A cosa serve questa funzionalità

Confronta 2–4 configurazioni esatte di Modelli o Agent con un unico Pacchetto di attività controllato e verificabile.

Prima di iniziare

Registra ogni configurazione esatta, apri i servizi pertinenti dei fornitori, rimuovi i dati sensibili e ricorda che le norme dei fornitori si applicano a tutto ciò che invii.

Tutorial dettagliato

  1. 1Scegli 2–4 configurazioni esatte di Modelli o Agent; non considerare il nome di una famiglia una configurazione riproducibile.
  2. 2Carica un modello oppure crea un Pacchetto di attività modificabile, quindi fissalo prima di raccogliere i risultati.
  3. 3Esegui personalmente ogni attività bloccata in ogni configurazione e incolla nella matrice ciascun output completo.
  4. 4Usa una revisione bilanciata, in cieco e di tutte le coppie. Registra Superato, Non superato, Non conclusivo o Non testato e gli errori critici; mantieni latenza e costo come osservazioni separate e non creare un punteggio generale sintetico.
  5. 5Esamina le evidenze mostrate e conferma esplicitamente l’esito della decisione. Per impostazione predefinita esporta i metadati; includi gli output grezzi completi solo dopo aver ottenuto il consenso e verifica localmente il pacchetto esportato.

Come leggere il risultato

Il risultato è un esito confermato dall’utente e legato al Pacchetto di attività bloccato e alle configurazioni registrate. Per impostazione predefinita vengono esportati solo i metadati; l’esportazione completa dei dati grezzi richiede il consenso esplicito e può essere verificata dal verificatore locale.

Cosa non può dimostrare

Nascondere le etichette riduce la distorsione dovuta ai nomi visibili, ma non costituisce un doppio cieco. OpenGPT non gestisce i fornitori né dimostra l’origine degli output, l’accuratezza della configurazione, la completezza, la privacy presso fornitori esterni o la generalizzazione oltre queste attività. I risultati delle prove private sono Testati sul tuo lavoro, non Evidenza pubblica.

Domanda frequente: Proof Lab carica prompt o output non elaborati?

La prova viene eseguita nel browser. La modalità temporanea conserva gli output grezzi in memoria; è facoltativo mantenerli su questo dispositivo. L’esportazione dei metadati esclude gli output grezzi e l’esportazione completa dei dati grezzi richiede il consenso esplicito.

Torna all’inizio
12

Insiemi di attività salvati e nuova valutazione

Riutilizza gli stessi prompt reali in una successiva valutazione dei modelli senza ricreare l’insieme di attività.

Aperto

A cosa serve questa funzionalità

Usa gli insiemi di attività salvati per rendere più coerenti i confronti futuri e valutare nuovamente versioni esatte dei modelli dopo una release o una modifica dei dati pubblici.

Prima di iniziare

Completa titoli e prompt delle attività, scegli un nome chiaro per l’insieme di attività e usa lo stesso browser e lo stesso dispositivo. Un insieme di attività può contenere testo di lavoro sensibile: rimuovi quindi i dati privati prima di salvarlo.

Tutorial dettagliato

  1. 1Nella valutazione su attività reali, prepara o modifica un insieme di attività rappresentativo del tuo lavoro.
  2. 2Assegna un nome riconoscibile all’insieme di attività e salvalo.
  3. 3In seguito, scegli l’insieme di attività salvato e caricalo nella valutazione Attuale.
  4. 4Seleziona due versioni esatte dei modelli ed esegui ogni prompt con impostazioni confrontabili.
  5. 5Da un risultato completato, scegli Ripeti valutazione per conservare le attività e le versioni dei modelli cancellando risposte precedenti, giudizi e report anteriore.

Come leggere il risultato

Il nome dell’insieme di attività, il modello predefinito, la lingua, i titoli delle attività e i prompt vengono archiviati localmente per essere riutilizzati. La nuova valutazione avvia un’esecuzione pulita mantenendo gli input di test previsti.

Cosa non può dimostrare

Gli insiemi di attività salvati esistono solo su questo dispositivo e non vengono sincronizzati né sottoposti a backup. Le risposte, le scelte dei modelli, le revisioni, i report e le chiavi API non vengono salvati in un insieme di attività. La cancellazione dei dati del sito può rimuovere tutti gli insiemi salvati.

Domanda frequente: Cosa cambia quando scelgo Valuta di nuovo?

OpenGPT conserva le stesse attività e le versioni esatte dei modelli, quindi cancella risposte, punteggi, giudizi, stato di visualizzazione e report precedenti, in modo che la nuova esecuzione sia indipendente dal vecchio risultato.

Torna all’inizio
13

Report della decisione condivisibile

Crea un link rispettoso della privacy per una rosa di modelli ufficiali e la relativa data limite dei dati pubblici.

Aperto

A cosa serve questa funzionalità

Usa il report per condividere l’attività e le versioni ufficiali esatte prese in considerazione, le evidenze pubbliche disponibili e l’eventuale candidato selezionato.

Prima di iniziare

Crea il report da una classifica per attività. Prima di condividerlo, conferma l’attività, gli ID modello esatti, la data limite dei dati e la scelta facoltativa.

Tutorial dettagliato

  1. 1Apri una classifica per attività e crea un report a partire da due o tre candidati ufficiali.
  2. 2Facoltativamente, contrassegna un modello come selezionato; è possibile lasciare vuota la scelta.
  3. 3Esamina la copertura dei dati pubblici e i limiti del report.
  4. 4Copia il link, usa il menu di condivisione del dispositivo, stampalo oppure scarica il record JSON ripulito.
  5. 5Un destinatario può aprire la stessa rosa di candidati, confrontare dati pubblici o avviare una valutazione su attività reali.

Come leggere il risultato

L’URL condiviso contiene solo l’ID dell’attività, gli ID ufficiali esatti dei modelli, la data limite dei dati pubblici e il modello eventualmente selezionato, affinché il destinatario possa esaminare lo stesso elenco ristretto.

Cosa non può dimostrare

Il report condivisibile non contiene prompt, risposte dei modelli, note, chiavi API o il report di valutazione completo. È il registro di un elenco ristretto, non la prova di un vincitore universale o di un output autenticato dal fornitore.

Domanda frequente: Qualcuno può vedere i contenuti della mia valutazione dal link di condivisione?

No. Prompt, risposte, note, chiavi API e progetto di valutazione locale sono esclusi. Se hai aggiunto informazioni al di fuori del flusso di report supportato, esamina sempre il link prima di condividerlo.

Torna all’inizio
14

Verifica del report

Verifica la struttura, la coerenza interna, i pattern di segreti e l’impronta digitale locale dei report JSON supportati.

Aperto

A cosa serve questa funzionalità

Usa il verificatore per esaminare un pacchetto OpenGPT Evidence v1 o v2 oppure un report V3 scaricato dallo Spazio di lavoro decisionale. Ogni controllo viene eseguito localmente nel browser.

Prima di iniziare

Procurati il file JSON originale. Per un report di confronto, scaricalo dallo Spazio di lavoro decisionale; completa prima ogni caso se ti serve un risultato completo anziché una bozza.

Tutorial dettagliato

  1. 1Scegli il file JSON; resterà in questo browser.
  2. 2Verifica che il controllo riconosca Evidence v1/v2, OpenGPT private comparison v1/v2 o Spazio di lavoro decisionale v3.
  3. 3Per i pacchetti di evidenze, esamina campi obbligatori, esecuzioni, indicatori temporali, punteggi e controlli per evitare segreti. Per i report di confronto, esamina i nomi dei candidati, la suite di attività, lo stato di bozza o completo, i casi univoci e la corrispondenza del riepilogo con i verdetti registrati.
  4. 4Leggi il riepilogo dichiarato e salva l’impronta digitale SHA-256 se devi confermare in seguito che venga esaminato lo stesso identico file.
  5. 5Se un controllo non viene superato, correggi i dati di origine o completa i casi di confronto mancanti, anziché modificare il report scaricato per forzarne il superamento.

Come leggere il risultato

Per Evidence v1/v2, Superato significa che il pacchetto rispetta le regole supportate di struttura e coerenza, mentre Demo contrassegna un esempio. Per un report di confronto, Superato significa che un report completo è coerente internamente; Bozza significa che la struttura è valida ma il confronto non è terminato. Non superato significa che almeno un controllo obbligatorio deve essere esaminato.

Cosa non può dimostrare

Un esito positivo non dimostra che il modello indicato abbia prodotto le risposte incollate, che le affermazioni del fornitore siano vere o che il risultato sia valido oltre i test registrati. I risultati di file non correlati non sono automaticamente confrontabili.

Domanda frequente: Il superamento della verifica di un report di confronto dimostra che un modello è migliore?

No. Conferma soltanto che il report supportato sia strutturalmente valido e internamente coerente. Devi comunque valutare l’identità del modello, la qualità del test, gli output e la pertinenza decisionale.

Torna all’inizio
15

Metodologia di valutazione

Scopri cosa rende una decisione sul modello esaminabile e riproducibile.

Aperto

A cosa serve questa funzionalità

Usa questa pagina prima di progettare, pubblicare o adottare una valutazione. Distingue la qualità delle evidenze dalla popolarità dei modelli.

Prima di iniziare

Inizia con una domanda decisionale concreta, versioni dei modelli specificate, attività rappresentative e un piano per conservare gli output grezzi.

Tutorial dettagliato

  1. 1Scrivi la decisione e i criteri di esito positivo prima di vedere i risultati.
  2. 2Usa lo stesso insieme di attività, le stesse impostazioni e le stesse regole di punteggio per ogni candidato.
  3. 3Preserva prompt, output, impostazioni, errori, indicatori temporali e impronte digitali della suite.
  4. 4Indica ciò che è stato svolto manualmente, automatizzato, esaminato con le etichette dei modelli nascoste, randomizzato o riprodotto in modo indipendente.
  5. 5Pubblica le conclusioni insieme all’incertezza e a limitazioni esplicite.

Come leggere il risultato

Evidence v1/v2 controlla principalmente formato e dichiarazioni. Lo Spazio di lavoro decisionale V3 supporta il ricalcolo locale (L3); la riproduzione indipendente L4 resta non supportata.

Cosa non può dimostrare

Un processo rigoroso può ridurre le distorsioni, ma non può garantire che un campione rappresenti ogni utente, lingua, versione futura o condizione di produzione.

Domanda frequente: È sempre necessario un livello di evidenze più elevato?

Adegua il rigore alle conseguenze. Per una prova personale può bastare L1; una dichiarazione pubblica o ad alto rischio dovrebbe cercare evidenze indipendenti più solide.

Torna all’inizio

Glossario in linguaggio semplice

Usa queste definizioni quando un’etichetta non ti è familiare.

Registro della fonte
Una riga conservata da una classifica pubblicata, con l’ID o il nome del modello di origine mantenuto esattamente per verifica e revisione.
ID modello ufficiale
Un identificatore di modello documentato dal fornitore che OpenGPT mantiene separato dal nome del record di origine.
Versione del catalogo
Una versione del modello elencata nella documentazione del fornitore, con la relativa destinazione ufficiale e la fonte di verifica.
Intervallo probabile del punteggio
Un intervallo di incertezza pubblicato attorno al punteggio visualizzato. Intervalli più ampi indicano una precisione minore; gli intervalli di fonti di classifica diverse non sono direttamente confrontabili.
I miei modelli
Una rosa di candidati archiviata solo in questo browser. Non è un account, una sincronizzazione cloud o un preferito del fornitore.
Idoneità ai requisiti
Un’etichetta qualitativa di idoneità della famiglia insieme al numero di requisiti soddisfatti; nessuno dei due valuta le singole versioni. Verifica la disponibilità e confronta versioni esatte sulle stesse attività.
Famiglia di modelli
Un gruppo di versioni correlate di un modello. Funzionalità, prezzi e accesso possono variare tra le versioni.
Benchmark
Un insieme ripetibile di attività e una regola di valutazione usati per confrontare sistemi nelle condizioni indicate.
Configurazione dell’Agent
Il modello di base, lo scaffold, gli strumenti, le autorizzazioni, il budget, l’ambiente, la versione del benchmark e la data che hanno prodotto un risultato di Agent.
Grado delle evidenze
Un’etichetta che descrive come è stato prodotto o verificato un risultato. Non modifica il punteggio di origine.
Costo per successo
Costo di valutazione indicato diviso per le attività riuscite. Viene mostrato soltanto quando esistono dati di origine comparabili; un costo mancante non equivale a zero.
File delle evidenze
Un record strutturato che dichiara come è stata eseguita una valutazione e che cosa ha osservato.
Schema
Le regole leggibili dal computer che definiscono i campi obbligatori e i valori consentiti in un file.
Impronta SHA-256
Un identificatore locale per i byte esatti di un file; se il file cambia, cambia anche l’impronta.

Risoluzione dei problemi

Nessun modello soddisfa tutti i requisiti

Verifica quale requisito ha escluso ciascun candidato, quindi allenta solo un vincolo realmente flessibile.

Requisiti della revisione

Un numero di posizione della fonte viene saltato

L’editore può usare posizioni a pari merito o più configurazioni. OpenGPT conserva la posizione originale anziché rinumerare le righe visibili.

Esamina la classifica

Un risultato di Agent non dispone di dati su costi o affidabilità

La fonte non ha pubblicato un valore confrontabile. OpenGPT lo lascia non dichiarato anziché considerarlo pari a zero; confronta solo valori appartenenti allo stesso ambito del benchmark.

Esamina le evidenze relative agli Agent

Una riga non ha un ID ufficiale del modello

È un record di origine completo, non uno stato irrisolto. Apri la fonte originale; usa la directory dei modelli quando ti servono l’identità documentata dal fornitore e l’accesso ufficiale.

Esamina l’identità della fonte

I miei modelli è vuoto o è scomparso

Usa lo stesso profilo del browser e lo stesso dispositivo. La modalità privata, il blocco dello spazio di archiviazione o la cancellazione dei dati del sito possono rimuovere l’elenco locale.

Apri I miei modelli

Non è possibile aggiungere un record al confronto dei dati

Il confronto dei dati accetta gli ID modello del catalogo. Lo stesso modello potrebbe essere già selezionato oppure l’elenco potrebbe aver raggiunto il limite di quattro modelli. Scegli un’altra versione del catalogo o rimuovi prima un candidato.

Apri la directory dei modelli

La prova in Proof Lab è incompleta

Torna alla prova e completa tutti gli output obbligatori per ogni configurazione e attività, lo stato della revisione, il controllo degli errori critici e l’esito confermato dall’utente.

Continua in Proof Lab

Una bozza locale è in conflitto o deve essere reimpostata

Torna a Confronta, esamina l’avviso relativo alla bozza locale più recente, quindi scegli consapevolmente se conservarla o reimpostarla.

Esamina la bozza locale

Un file di evidenza non supera la verifica

Usa la voce non superata dell’elenco di controllo per correggere il registro della fonte. Non inserire segreti né riscrivere i risultati.

Apri lo strumento di verifica
contact@opengpt.com

Hai ancora bisogno di aiuto?

Segnala un link non funzionante, un dettaglio errato del modello o un problema che non sei riuscito a risolvere.

Assistenza via e-mail