Decisioni indipendenti sui modelli

Classifica dei modelli IA

Crea un elenco ristretto di versioni esatte dei modelli a partire dalle evidenze pubbliche, confrontale su una stessa base e poi verifica la scelta sulla tua attività.

Attività oggettiveLiveBench · Visualizzate 3 di 10
  1. Posizione 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. Posizione 2Claude Fable 5 Max EffortAnthropic82.97
  3. Posizione 3GPT-6 Astra Max EffortOpenAI82.16
Dati da valutazioni pubblicate2 fonti pubbliche esterneLiveBench · Dati di questa edizione aggiornati al

OpenGPT organizza e presenta dati pubblici provenienti da valutazioni di terze parti; non ha rieseguito i test sui modelli. Usa la classifica per capire le prestazioni relative, poi verifica i candidati sulle tue attività.

Edizione dei dati
2026-09Pubblicato ·
Ambito della decisione automatizzata
20 nella verifica automatizzata / 79 modelli del catalogoData limite dei dati · 2026-08-30
Istantanea Attuale della classifica · LiveBench
2026-09-07 · 56 record di origine
Ultima edizione comparabile delle modifiche · LiveBench
Sconosciuto
Copertura del ciclo di vita
36 stati del ciclo di vita documentati / 79 · 20 nell’ambito dell’automazioneData limite dei dati · 2026-08-30

Scegli una prospettiva di classifica

Inizia dalla decisione che devi prendere. Ogni scenario apre il segnale di classifica pubblicato più pertinente. La fonte e la scala originali restano visibili.

Scegli cosa mostrare

Mostra tutti i record pubblicati con l’ID o il nome modello della fonte, inclusi alias e configurazioni. Le posizioni della fonte vengono mantenute.

Attività oggettive. Punteggio complessivo LiveBench su 23 attività valutate oggettivamente in sette categorie.

Visualizzate 10 di 10. Attività oggettive.

  1. Posizione 1
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    claude-fable-5-1-max-effort
    Attività oggettive
    83.41
    Fonte originale
  2. Posizione 2
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    claude-fable-5-max-effort
    Attività oggettive
    82.97
    Fonte originale
  3. Posizione 3
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    gpt-6-astra-max
    Attività oggettive
    82.16
    Fonte originale
  4. Posizione 4
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    muse-spark-1.3-xhigh
    Attività oggettive
    81.59
    Fonte originale
  5. Posizione 5
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    gpt-5.6-sol-max
    Attività oggettive
    81.05
    Fonte originale
  6. Posizione 6
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    gpt-5.5-xhigh
    Attività oggettive
    80.19
    Fonte originale
  7. Posizione 7
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    claude-opus-5-max-effort
    Attività oggettive
    80.08
    Fonte originale
  8. Posizione 8

    Kimi K3

    Moonshot AI
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    kimi-k3
    Attività oggettive
    79.19
    Fonte originale
  9. Posizione 9
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    gemini-3.7-flash-high
    Attività oggettive
    78.83
    Fonte originale
  10. Posizione 10
    Impostazioni del modello
    Published benchmark configuration
    ID modello nella fonte
    qwen3.8-max
    Attività oggettive
    78.46
    Fonte originale
Fonte indipendenteLiveBench10 voci pubblicate · Data di acquisizione: 9 set 2026
LiveBench

Stato del monitoraggioStato in tempo reale non disponibilePubblicazione automatica convalidata

Data dei dati di origine
Acquisito da OpenGPT
Ultima modifica della classifica

LMArena + LiveBench: pubblicazione automatica convalidata · Fonti in pausa: solo Storiche

Metodo di classificaOgni vista conserva la metrica, la versione e la metodologia della fonte. Segui i link per verificare il lavoro sottostante.

Base della classifica

Classifica pubblicata completa e ID modello ufficiali

La classifica principale conserva ogni registro degli editori e mostra l’ID del modello o il nome della fonte. Ogni riga può essere confrontata: le mappature esatte e sicure a livello di configurazione usano versioni ufficiali; tutte le altre righe rimangono all’interno di una singola classifica della fonte. I dati mancanti non diventano mai un punteggio pari a zero.
79 ID ufficiali di modelli
79
0 con dati pubblici di classifica
0
79 in attesa di dati comparabili
79
LiveBench · 56 record di origine conservati per la revisione
56
Catalogo modelli

Base della classifica

Come leggere questa edizione della ricerca

  • I punteggi rimangono sulle scale originali degli editori. Non vengono combinati in un punteggio composito.

  • Dati mancanti non significa zero. Significa che il publisher non ha indicato quella metrica per questa istantanea.

  • Quando una fonte riporta le impostazioni del modello, la posizione si applica a quella configurazione esatta e a quella release della fonte, non a ogni attività, regione o distribuzione.

  • Nessun fornitore può pagare per il posizionamento. OpenGPT rimanda direttamente alle evidenze utilizzate.

Base della classifica

Dati e fonti

Ogni vista conserva la metrica, la versione e la metodologia della fonte. Segui i link per verificare il lavoro sottostante.
AR

LMArena

La classifica generale completa più recente, con stile controllato, basata sul confronto affiancato da parte degli utenti di due risposte dei modelli.

Data di pubblicazione della classifica
2 set 2026
Data di acquisizione
9 set 2026
Licenza
CC BY 4.0

Classifica originaleMetodologia

LB

LiveBench

Ventitré attività oggettive in sette categorie; le domande vengono aggiornate ogni sei mesi.

Versione dati
LiveBench-2026-06-25
Data di acquisizione
9 set 2026
Licenza
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

Classifica originaleMetodologia

Versione del metodo

Un ritmo di pubblicazione prevedibile

OpenGPT controlla le fonti attive dei modelli ogni sei ore. LMArena e LiveBench pubblicano soltanto dopo il superamento delle rispettive politiche di convalida con versione. Le fonti in pausa restano Storiche e non entrano nelle classifiche Attuali.
  1. 01

    Controllo fonti ogni 6 h

    Gli aggiornamenti di LMArena e LiveBench vengono pubblicati automaticamente soltanto dopo i controlli su schema, completezza, data, integrità e anomalie. Le fonti in pausa restano Storiche.

  2. 02

    Riepilogo settimanale delle modifiche

    Riassume le modifiche rilevanti a posizioni, modelli e fonti in un unico aggiornamento verificabile.

  3. 03

    Snapshot storico mensile

    Congela uno snapshot datato con configurazioni esatte, versioni delle fonti e correzioni.