Bronnen van openbare ranglijsten

LiveBench AI gegevens over modelrangschikking

OpenGPT behoudt 30 gepubliceerde LiveBench-records binnen hun oorspronkelijke bronbereik. Het voert deze ranglijst niet opnieuw uit en vermengt die niet met een andere benchmark.

Gepubliceerde records
30
Rangschikkingsweergaven
Objective tasks · Cost per score point · Open-weight models
Datum van brongegevens
Opgehaald

Bewijsbereik

LiveBench-2026-06-25. 51 gepubliceerde modelconfiguraties voor drieëntwintig objectieve taken en zeven categorieën; vragen worden elke zes maanden vernieuwd.

How OpenGPT handles this evidence

OpenGPT bewaart de labels, posities, configuraties, datums en waarden van de uitgever binnen hetzelfde gepubliceerde bereik. Het zet ontbrekende waarden niet om in nul en voegt deze bron niet samen tot een score over meerdere bronnen.

Vergelijkingsgrenzen

  • Posities en waarden zijn alleen vergelijkbaar binnen de genoemde bronrelease en het rangschikkingsbereik.
  • Een configuratie uit de bronlijst wordt pas aan een officieel model ID gekoppeld nadat het bewijs van identiteit is beoordeeld.
  • Gepubliceerde ranglijsten zijn selectiesignalen; een productiekeuze vereist nog steeds dat de exacte versie met echt werk wordt getest.

LiveBench-2026-06-25

18 representatieve rijen uit 30 gepubliceerde records weergegeven. Volg een rij om de exacte bronidentiteit en het koppelingsbewijs te bekijken.

  1. Claude Fable 5.1 Max EffortAnthropic · Objective taken#183.41Published benchmark configuration
  2. Claude Fable 5 Max EffortAnthropic · Objective taken#282.97Published benchmark configuration
  3. GPT-6 Astra Max EffortOpenAI · Objective taken#382.16Published benchmark configuration
  4. Muse Spark 1.3 xHigh EffortMeta · Objective taken#481.59Published benchmark configuration
  5. GPT-5.6 Sol Max EffortOpenAI · Objective taken#581.05Published benchmark configuration
  6. GPT-5.5 Thinking xHigh EffortOpenAI · Objective taken#680.19Published benchmark configuration
  7. Grok Build 0.1xAI · Cost per score point#1$0.0240Published benchmark configuration
  8. GLM-5.3 FlashZ.AI · Cost per score point#2$0.0305Published benchmark configuration
  9. Qwen 3.8 Flash NextAlibaba · Cost per score point#3$0.0423Published benchmark configuration
  10. DeepSeek V4 Pro 0813DeepSeek · Cost per score point#4$0.0442Published benchmark configuration
  11. DeepSeek V4 Flash Vision ExpDeepSeek · Cost per score point#5$0.0505Published benchmark configuration
  12. DeepSeek V4 Flash 0731DeepSeek · Cost per score point#6$0.0596Published benchmark configuration
  13. Kimi K3Moonshot AI · Open-weight models#179.19Open gewichten
  14. Qwen 3.8 MaxAlibaba · Open-weight models#278.46Open gewichten
  15. DeepSeek V4 Pro 0813DeepSeek · Open-weight models#377.44Open gewichten
  16. DeepSeek V4 Flash Vision ExpDeepSeek · Open-weight models#476.76Open gewichten
  17. Qwen 3.8 Flash NextAlibaba · Open-weight models#576.19Open gewichten
  18. GLM-5.3Z.AI · Open-weight models#676.14Open gewichten