Onafhankelijke modelbeslissingen

AI-modelranglijsten

Selecteer exacte modelversies uit openbaar bewijs, vergelijk ze op één basis en verifieer de keuze vervolgens met uw eigen taak.

Objectieve takenLiveBench · 3 van 10 getoond
  1. Rang 1Claude Fable 5.1 Max EffortAnthropic83.41
  2. Rang 2Claude Fable 5 Max EffortAnthropic82.97
  3. Rang 3GPT-6 Astra Max EffortOpenAI82.16
Gegevens uit gepubliceerde evaluaties2 externe openbare bronnenLiveBench · Gegevens van deze editie tot en met

OpenGPT ordent en presenteert openbaar gepubliceerde evaluatiegegevens van derden; de modellen zijn niet opnieuw getest. Gebruik de ranglijst om relatieve prestaties te begrijpen en toets kandidaten daarna op je eigen taken.

Gegevenseditie
2026-09Gepubliceerd ·
Reikwijdte van geautomatiseerde beslissing
20 in geautomatiseerde verificatie / 79 catalogusmodellenGegevenspeildatum · 2026-08-30
Actuele ranglijstsnapshot · LiveBench
2026-09-07 · 56 bronrecords
Nieuwste editie met vergelijkbare wijzigingen · LiveBench
Onbekend
Dekking van levenscyclus
36 levenscyclusstatus gedocumenteerd / 79 · 20 binnen automatiseringsbereikGegevenspeildatum · 2026-08-30

Kies een ranglijstperspectief

Begin met de beslissing die u moet nemen. Elk scenario opent het relevantste gepubliceerde rangschikkingssignaal. De oorspronkelijke bron en schaal blijven zichtbaar.

Kies wat wordt getoond

Toont alle gepubliceerde records met de model-ID van modelnaam van de bron, inclusief aliassen en configuraties. Bronposities blijven behouden.

Objectieve taken. Algehele LiveBench-score voor 23 objectief beoordeelde taken in zeven categorieën.

10 van 10 getoond. Objectieve taken.

  1. Rang 1
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    claude-fable-5-1-max-effort
    Objectieve taken
    83.41
    Oorspronkelijke bron
  2. Rang 2
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    claude-fable-5-max-effort
    Objectieve taken
    82.97
    Oorspronkelijke bron
  3. Rang 3
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    gpt-6-astra-max
    Objectieve taken
    82.16
    Oorspronkelijke bron
  4. Rang 4
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    muse-spark-1.3-xhigh
    Objectieve taken
    81.59
    Oorspronkelijke bron
  5. Rang 5
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    gpt-5.6-sol-max
    Objectieve taken
    81.05
    Oorspronkelijke bron
  6. Rang 6
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    gpt-5.5-xhigh
    Objectieve taken
    80.19
    Oorspronkelijke bron
  7. Rang 7
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    claude-opus-5-max-effort
    Objectieve taken
    80.08
    Oorspronkelijke bron
  8. Rang 8

    Kimi K3

    Moonshot AI
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    kimi-k3
    Objectieve taken
    79.19
    Oorspronkelijke bron
  9. Rang 9
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    gemini-3.7-flash-high
    Objectieve taken
    78.83
    Oorspronkelijke bron
  10. Rang 10
    Modelinstellingen
    Published benchmark configuration
    Bronmodel-ID
    qwen3.8-max
    Objectieve taken
    78.46
    Oorspronkelijke bron
Onafhankelijke bronLiveBench10 gepubliceerde vermeldingen · Verzameld op: 9 sep 2026
LiveBench

MonitoringsstatusLivestatus niet beschikbaarGevalideerde automatische publicatie

Datum van brongegevens
Opgehaald door OpenGPT
Laatste wijziging in de ranking

LMArena + LiveBench: gevalideerde automatische publicatie · Gepauzeerde bronnen: alleen Historisch

RanglijstmethodeElke weergave behoudt de meetwaarde, release en methodologie van de bron. Volg de koppelingen om het onderliggende werk te controleren.

Basis van de ranglijst

Volledige gepubliceerde ranglijst en officiële model-ID's

De hoofdranglijst behoudt elk uitgeversrecord en toont de model-ID of modelnaam uit de bron. Elke rij kan worden vergeleken: exacte, configuratieveilige koppelingen gebruiken officiële versies; alle andere rijen blijven binnen één bronranglijst. Ontbrekende gegevens worden nooit een nulscore.
79 officiële model-ID's
79
0 met openbare rangschikking gegevens
0
79 Wacht op vergelijkbare gegevens
79
LiveBench · 56 bronrecords bewaard voor audit
56
Modeloverzicht

Basis van de ranglijst

Zo leest u deze onderzoekseditie

  • Scores blijven op de oorspronkelijke schalen van de uitgevers. Ze worden niet tot een samengestelde score gecombineerd.

  • Ontbrekende gegevens betekenen niet nul. Ze betekenen dat de uitgever die meetwaarde voor deze momentopname niet heeft gerapporteerd.

  • Wanneer een bron modelinstellingen rapporteert, geldt de positie voor die exacte configuratie en bronrelease — niet voor elke taak, regio of implementatie.

  • Geen provider kan betalen voor plaatsing. OpenGPT koppelt rechtstreeks naar het gebruikte bewijs.

Basis van de ranglijst

Gegevens en bronnen

Elke weergave behoudt de meetwaarde, release en methodologie van de bron. Volg de koppelingen om het onderliggende werk te controleren.
AR

LMArena

De volledige nieuwste stijlgestuurde algehele ranglijst, gebaseerd op gebruikers die twee modelantwoorden naast elkaar vergelijken.

Publicatiedatum van de ranglijst
2 sep 2026
Verzameld op
9 sep 2026
Licentie
CC BY 4.0

Originele ranglijstMethodologie

LB

LiveBench

Drieëntwintig objectieve taken in zeven categorieën; vragen worden elke zes maanden vernieuwd.

Dataversie
LiveBench-2026-06-25
Verzameld op
9 sep 2026
Licentie
Apache-2.0 project license; exact new-livebench publication repository does not repeat a LICENSE file

Originele ranglijstMethodologie

Methodeversie

Een voorspelbaar publicatieritme

OpenGPT controleert actieve modelbronnen elke zes uur. LMArena en LiveBench publiceren pas nadat hun versiegebonden validatiebeleid is geslaagd. Gepauzeerde bronnen blijven Historisch en komen niet in Actuele ranglijsten.
  1. 01

    Broncontrole elke 6 uur

    LMArena- en LiveBench-updates worden pas automatisch gepubliceerd na controles op schema, volledigheid, datum, integriteit en afwijkingen. Gepauzeerde bronnen blijven Historisch.

  2. 02

    Wekelijks wijzigingsoverzicht

    Vat belangrijke wijzigingen in rankings, modellen en bronnen samen in één controleerbare update.

  3. 03

    Maandelijkse historiesnapshot

    Bevriest een gedateerde snapshot met exacte configuraties, bronversies en correcties.