Nessun modello soddisfa tutti i requisiti
Verifica quale requisito ha escluso ciascun candidato, quindi allenta solo un vincolo realmente flessibile.
Requisiti della revisioneTrova il flusso di lavoro giusto, segui ogni passaggio e comprendi cosa può e non può dirti il risultato.
Ogni flusso di lavoro risponde a una domanda diversa. Parti dall’obiettivo più vicino, quindi segui la guida collegata.
Scopri cosa viene classificato, da dove provengono i dati e quali registri includono un ID ufficiale del modello.
Usa ogni prospettiva di classifica per esaminare i segnali pubblicati, verificare i registri delle fonti e creare un elenco ristretto per i test su attività reali.
Inizia dalla domanda a cui devi rispondere. Le classifiche relative a preferenze degli utenti, capacità complessive, attività oggettive, costi e pesi aperti utilizzano fonti e scale diverse.
Una posizione è relativa a una fonte e a un ambito. I pareggi possono far saltare i numeri delle posizioni e i punteggi ottenuti da prospettive di classifica diverse non sono direttamente confrontabili.
OpenGPT organizza dati pubblici di terze parti e non ha ripetuto queste valutazioni. Nessuna classifica identifica il modello migliore per ogni utente o attività.
Ora ogni riga contiene i dettagli del modello e un’azione di confronto. OpenGPT aggiunge un ID modello ufficiale soltanto quando la documentazione del fornitore dimostra l’associazione esatta; in caso contrario, il confronto dei record di origine conserva il nome del publisher, la configurazione e i dati di classifica senza inventare un nuovo ID ufficiale.
Scegli un Agent in base all’attività, alla configurazione completa, alla qualità delle evidenze e ai risultati comparabili.
Esplora 96 configurazioni pubblicate di valutazione degli Agent in sette ambiti di attività, oltre a 109 risultati BFCL separati di modelli per l’uso degli strumenti, senza trasformare evidenze incompatibili in un unico punteggio.
Il risultato di un agente appartiene a una configurazione completa: modello di base, scaffold, strumenti, autorizzazioni, budget, ambiente, versione del benchmark e data. OpenGPT conserva i campi riportati dalla fonte e lascia quelli mancanti non dichiarati, invece di considerarli pari a zero.
Una posizione descrive una configurazione completa del sistema nell’ambito di un benchmark. Interpretala considerando il livello di evidenza, l’attualità, il numero di campioni o esecuzioni e gli eventuali campi relativi a costi e affidabilità.
OpenGPT non crea un punteggio universale degli Agent. Salvo quando un risultato è contrassegnato esplicitamente come riprodotto, OpenGPT organizza evidenze a monte anziché ripetere la valutazione; nessun benchmark dimostra l’idoneità alla produzione per ogni flusso di lavoro.
Uno scaffold, una versione del modello, un insieme di strumenti, un livello di autorizzazione, un budget o un’impostazione del benchmark diversi creano una configurazione dell’agente distinta che deve rimanere un record separato.
Invia per la revisione un registro pubblico di identità o evidenze senza modificare le classifiche.
Usa il flusso di invio quando manca un ID ufficiale del modello o un prodotto Agent oppure quando una fonte pubblica richiede una revisione editoriale.
Accedi con un account verificato e prepara una fonte HTTPS pubblica. Non inviare mai credenziali, file privati o informazioni personali.
Un invio riuscito riceve un numero di riferimento ed entra nella coda di revisione. Un prodotto Agent approvato è un record della directory pubblica, non una posizione in classifica né un’approvazione di OpenGPT.
Gli autori degli invii non possono impostare posizione, grado delle evidenze, comparabilità o stato della pubblicazione. I limiti sui duplicati e sulla frequenza riducono gli abusi e l’approvazione non modifica mai automaticamente una classifica.
I prodotti Agent approvati sono ricercabili nella directory, ma per una classifica servono comunque evidenze pubbliche di valutazione comparabili.
Monitora i movimenti tra istantanee confrontabili e confronta gli ID dei modelli a catalogo.
Usa questa pagina per vedere cosa è cambiato rispetto all’istantanea precedente della fonte, quali registri sono apparsi per la prima volta, in che modo differiscono le versioni esatte e quando sono stati recuperati i dati.
Le variazioni Storiche usano attualmente l’ambito delle preferenze degli utenti di LMArena. Le altre fonti attive restano limitate ai dati Attuali finché non esiste un’istantanea precedente comparabile.
OpenGPT calcola le variazioni soltanto quando fonte, ambito, unità e metodo corrispondono e conserva istantanee mensili scaricabili.
Soltanto le date di rilascio documentate dal fornitore sono considerate versioni del prodotto. Il confronto tra versioni non deduce velocità, prezzo, lunghezza del contesto o qualità dai nomi.
OpenGPT non ha fissato un’edizione precedente comparabile per questa fonte attiva. Le fonti in pausa restano Storiche anziché contribuire alle variazioni Attuali.
Parti da uno scenario di lavoro reale ed esamina tre versioni ufficiali dei modelli che vale la pena testare per prime.
Usa le classifiche delle attività per trasformare ampi segnali pubblici in un elenco ristretto, pratico e contenuto per programmazione, ricerca, documenti, assistenza, lavoro multilingue, lavoro multimodale, costo, privacy o velocità.
Scegli l’attività più vicina al tuo lavoro, quindi annota i prompt, i dati, gli strumenti, la regione, il budget e i requisiti di privacy effettivi. Le evidenze pubbliche mostrate possono riguardare un ambito più ampio rispetto alla tua attività.
Ottieni tre candidati iniziali ufficiali, evidenze pubbliche visibili quando disponibili e percorsi diretti per confrontarli o eseguire un test su un’attività reale.
Una classifica per attività è una rosa iniziale di candidati, non una classifica universale né la prova del modello migliore. L’assenza di evidenze non equivale a zero e fonti pubbliche diverse non vengono combinate in un unico punteggio.
Una versione ufficiale può essere pertinente all’attività per il posizionamento del prodotto o il tipo di distribuzione anche quando nessun risultato della versione esatta è associato alla fonte pubblica selezionata. L’evidenza mancante rimane visibile e deve essere risolta con un test proprio.
Imposta i modelli che utilizzi, il lavoro ricorrente e le priorità, quindi esamina segnali prudenti per capire quando vale la pena effettuare un confronto equo.
Usa il radar per rispondere a una domanda pratica: esistono evidenze pubbliche confrontabili sufficienti per testare un’alternativa al modello che utilizzi ora?
Scegli le versioni ufficiali esatte, almeno un’attività ricorrente e fino a due priorità. Usa lo stesso browser e lo stesso dispositivo, perché la configurazione resta locale.
Il radar crea un controllo degli aggiornamenti locale sul dispositivo con il modello attuale, un’alternativa adatta all’attività quando disponibile, la data delle evidenze, i limiti di incertezza e azioni di confronto diretto.
Un controllo dell’aggiornamento non è un’istruzione a cambiare. Costi, velocità, privacy o contesto possono comunque richiedere test diretti e le impostazioni locali non vengono sincronizzate né incluse nel backup.
No. Significa che un segnale comparabile o una modifica del ciclo di vita rende utile un test sulla stessa attività. Cambia soltanto dopo che l’alternativa ha avuto successo sul tuo lavoro reale e con i tuoi vincoli.
Trasforma quattro requisiti pratici in un elenco ristretto spiegabile.
Usa lo strumento di ricerca quando sai quale lavoro devi svolgere, ma non quale serie di modelli esaminare per prima.
Individua l’attività principale, dove può essere eseguito il modello, la priorità operativa più importante e gli eventuali requisiti linguistici.
L’etichetta qualitativa e il conteggio delle corrispondenze ai requisiti si applicano alla serie di modelli, non alle singole versioni; nessuno dei due è un punteggio di benchmark. Verifica la disponibilità di distribuzione di ogni versione attuale elencata e confronta i candidati sulle stesse attività.
Lo strumento di ricerca non chiama modelli, non verifica i prezzi attuali e non indica un vincitore universale. Una serie di modelli può includere versioni con capacità diverse.
L’ordine riflette i vincoli selezionati, non la popolarità generale. Modifica un requisito per scoprire cosa ha determinato il risultato, quindi testa versioni esatte.
Esplora gli ID modello documentati dai fornitori, apri le pagine dei dettagli dedicate e verifica se esistono dati pubblici di classifica comparabili.
Usa la directory quando ti servono l’ID ufficiale esatto di un modello, la destinazione del fornitore, le attività adatte e non adatte, le fonti e uno stato chiaro dei dati della classifica.
Inserisci il nome di un modello o di un fornitore, un requisito di distribuzione oppure un’attività. Un ID modello documentato dal fornitore non garantisce dati pubblici di valutazione comparabili.
Classificato significa che a quell’ID modello esatto sono collegati dati comparabili pubblicati. Non classificato significa che questa edizione non dispone di un record comparabile adeguato; non equivale a un punteggio zero.
La documentazione del fornitore attesta l’identità nel catalogo, non la disponibilità Attuale in ogni Paese o livello di servizio. La copertura della classifica, i dettagli dei modelli e le condizioni dei fornitori possono cambiare dopo la data di revisione.
No. Significa che questa edizione non dispone di dati pubblici comparabili adatti per quell’ID modello. Provalo direttamente se resta pertinente alla tua decisione.
Confronta da due a quattro versioni ufficiali esatte oppure record di un’unica vista di classifica pubblicata.
Il confronto tra versioni ufficiali organizza gli ID documentati dai fornitori nelle fonti pubblicate. Il confronto tra record di origine conserva il nome e le impostazioni del publisher quando un confronto ufficiale esatto comporterebbe una perdita di informazioni.
Per le versioni ufficiali, scegli da due a quattro ID del catalogo. Per i record di origine, scegli da due a quattro righe della stessa fonte, dimensione e istantanea.
Il confronto crea un elenco ristretto consapevole delle evidenze e mostra dove mancano informazioni. Non produce un nuovo punteggio di benchmark né decreta un vincitore universale.
OpenGPT non chiama i modelli in questa vista. I punteggi pubblicati provenienti da fonti o ambiti diversi non sono intercambiabili e i dettagli dei modelli possono cambiare dopo la data di revisione.
Il confronto dei dati riassume le informazioni già pubblicate per un numero di modelli compreso tra due e quattro. La valutazione su attività reali accetta esattamente due versioni, ti chiede di eseguire gli stessi prompt in entrambi i servizi ed esamina le risposte incollate nascondendo le etichette visibili dei modelli.
Mantieni un piccolo elenco di lavoro delle voci in classifica in questo browser.
Usa Modelli salvati per tornare rapidamente ai candidati, aprire destinazioni attendibili e inserire in un confronto gli ID dei modelli supportati.
Usa lo stesso browser e dispositivo. L’elenco è archiviato localmente, senza account OpenGPT né sincronizzazione nel cloud.
Il conteggio accanto a Modelli salvati indica quante voci sono state salvate. L’identità della fonte e quella ufficiale del modello rimangono distinte.
L’elenco non è un account né una sincronizzazione dei segnalibri o un backup. Non sarà visibile in un altro browser o dispositivo e la navigazione privata, le limitazioni dello spazio di archiviazione o la cancellazione dei dati del sito possono rimuoverlo.
Verifica di usare lo stesso profilo del browser e lo stesso dispositivo. Se lo spazio di archiviazione del sito è stato cancellato o bloccato, OpenGPT non può ripristinare l’elenco locale.
Esegui una prova privata su un lavoro reale; in modalità temporanea, gli output grezzi restano in memoria a meno che tu non scelga esplicitamente di conservarli su questo dispositivo.
Confronta 2–4 configurazioni esatte di Modelli o Agent con un unico Pacchetto di attività controllato e verificabile.
Registra ogni configurazione esatta, apri i servizi pertinenti dei fornitori, rimuovi i dati sensibili e ricorda che le norme dei fornitori si applicano a tutto ciò che invii.
Il risultato è un esito confermato dall’utente e legato al Pacchetto di attività bloccato e alle configurazioni registrate. Per impostazione predefinita vengono esportati solo i metadati; l’esportazione completa dei dati grezzi richiede il consenso esplicito e può essere verificata dal verificatore locale.
Nascondere le etichette riduce la distorsione dovuta ai nomi visibili, ma non costituisce un doppio cieco. OpenGPT non gestisce i fornitori né dimostra l’origine degli output, l’accuratezza della configurazione, la completezza, la privacy presso fornitori esterni o la generalizzazione oltre queste attività. I risultati delle prove private sono Testati sul tuo lavoro, non Evidenza pubblica.
La prova viene eseguita nel browser. La modalità temporanea conserva gli output grezzi in memoria; è facoltativo mantenerli su questo dispositivo. L’esportazione dei metadati esclude gli output grezzi e l’esportazione completa dei dati grezzi richiede il consenso esplicito.
Riutilizza gli stessi prompt reali in una successiva valutazione dei modelli senza ricreare l’insieme di attività.
Usa gli insiemi di attività salvati per rendere più coerenti i confronti futuri e valutare nuovamente versioni esatte dei modelli dopo una release o una modifica dei dati pubblici.
Completa titoli e prompt delle attività, scegli un nome chiaro per l’insieme di attività e usa lo stesso browser e lo stesso dispositivo. Un insieme di attività può contenere testo di lavoro sensibile: rimuovi quindi i dati privati prima di salvarlo.
Il nome dell’insieme di attività, il modello predefinito, la lingua, i titoli delle attività e i prompt vengono archiviati localmente per essere riutilizzati. La nuova valutazione avvia un’esecuzione pulita mantenendo gli input di test previsti.
Gli insiemi di attività salvati esistono solo su questo dispositivo e non vengono sincronizzati né sottoposti a backup. Le risposte, le scelte dei modelli, le revisioni, i report e le chiavi API non vengono salvati in un insieme di attività. La cancellazione dei dati del sito può rimuovere tutti gli insiemi salvati.
OpenGPT conserva le stesse attività e le versioni esatte dei modelli, quindi cancella risposte, punteggi, giudizi, stato di visualizzazione e report precedenti, in modo che la nuova esecuzione sia indipendente dal vecchio risultato.
Verifica la struttura, la coerenza interna, i pattern di segreti e l’impronta digitale locale dei report JSON supportati.
Usa il verificatore per esaminare un pacchetto OpenGPT Evidence v1 o v2 oppure un report V3 scaricato dallo Spazio di lavoro decisionale. Ogni controllo viene eseguito localmente nel browser.
Procurati il file JSON originale. Per un report di confronto, scaricalo dallo Spazio di lavoro decisionale; completa prima ogni caso se ti serve un risultato completo anziché una bozza.
Per Evidence v1/v2, Superato significa che il pacchetto rispetta le regole supportate di struttura e coerenza, mentre Demo contrassegna un esempio. Per un report di confronto, Superato significa che un report completo è coerente internamente; Bozza significa che la struttura è valida ma il confronto non è terminato. Non superato significa che almeno un controllo obbligatorio deve essere esaminato.
Un esito positivo non dimostra che il modello indicato abbia prodotto le risposte incollate, che le affermazioni del fornitore siano vere o che il risultato sia valido oltre i test registrati. I risultati di file non correlati non sono automaticamente confrontabili.
No. Conferma soltanto che il report supportato sia strutturalmente valido e internamente coerente. Devi comunque valutare l’identità del modello, la qualità del test, gli output e la pertinenza decisionale.
Scopri cosa rende una decisione sul modello esaminabile e riproducibile.
Usa questa pagina prima di progettare, pubblicare o adottare una valutazione. Distingue la qualità delle evidenze dalla popolarità dei modelli.
Inizia con una domanda decisionale concreta, versioni dei modelli specificate, attività rappresentative e un piano per conservare gli output grezzi.
Evidence v1/v2 controlla principalmente formato e dichiarazioni. Lo Spazio di lavoro decisionale V3 supporta il ricalcolo locale (L3); la riproduzione indipendente L4 resta non supportata.
Un processo rigoroso può ridurre le distorsioni, ma non può garantire che un campione rappresenti ogni utente, lingua, versione futura o condizione di produzione.
Adegua il rigore alle conseguenze. Per una prova personale può bastare L1; una dichiarazione pubblica o ad alto rischio dovrebbe cercare evidenze indipendenti più solide.
Usa queste definizioni quando un’etichetta non ti è familiare.
Verifica quale requisito ha escluso ciascun candidato, quindi allenta solo un vincolo realmente flessibile.
Requisiti della revisioneL’editore può usare posizioni a pari merito o più configurazioni. OpenGPT conserva la posizione originale anziché rinumerare le righe visibili.
Esamina la classificaLa fonte non ha pubblicato un valore confrontabile. OpenGPT lo lascia non dichiarato anziché considerarlo pari a zero; confronta solo valori appartenenti allo stesso ambito del benchmark.
Esamina le evidenze relative agli AgentÈ un record di origine completo, non uno stato irrisolto. Apri la fonte originale; usa la directory dei modelli quando ti servono l’identità documentata dal fornitore e l’accesso ufficiale.
Esamina l’identità della fonteUsa lo stesso profilo del browser e lo stesso dispositivo. La modalità privata, il blocco dello spazio di archiviazione o la cancellazione dei dati del sito possono rimuovere l’elenco locale.
Apri I miei modelliIl confronto dei dati accetta gli ID modello del catalogo. Lo stesso modello potrebbe essere già selezionato oppure l’elenco potrebbe aver raggiunto il limite di quattro modelli. Scegli un’altra versione del catalogo o rimuovi prima un candidato.
Apri la directory dei modelliTorna alla prova e completa tutti gli output obbligatori per ogni configurazione e attività, lo stato della revisione, il controllo degli errori critici e l’esito confermato dall’utente.
Continua in Proof LabTorna a Confronta, esamina l’avviso relativo alla bozza locale più recente, quindi scegli consapevolmente se conservarla o reimpostarla.
Esamina la bozza localeUsa la voce non superata dell’elenco di controllo per correggere il registro della fonte. Non inserire segreti né riscrivere i risultati.
Apri lo strumento di verificaSegnala un link non funzionante, un dettaglio errato del modello o un problema che non sei riuscito a risolvere.