Documenten en onderbouwde vragen en antwoorden
Lange bestanden, samenvattingen, citaten en antwoorden die worden begrensd door de aangeleverde tekst.
- Waarom deze kandidaten
- Assumption · Historical. Vergelijk modellen voor langdurige context of bedrijfszoektoepassingen en test daarna exact citatie- en weigeringsgedrag.
- Wat blijft onzeker
- Claims over contextvensters tonen geen ophaalkwaliteit of getrouw gebruik van een lang document aan.
Drie officiële versies om eerst te testen
Openbare gegevens beperken het veld. Ze vervangen geen gecontroleerde test met uw eigen werk. Selecteer twee of drie kandidaten voor een vergelijking van openbare gegevens naast elkaar.
Unknown · Not automatically certified
Er is momenteel geen vergelijkbaar openbaar resultaat aan deze exacte versie gekoppeld.
Openbaar bewijsDe modellen gebruiken verschillende openbare bewijsschalen. Ontbrekend bewijs wordt niet als nul behandeld en OpenGPT combineert ongelijksoortige bronnen niet tot één score.+
Een praktisch uitgangspunt, geen universele winnaarSelecteer twee of drie kandidaten voor een vergelijking van openbare gegevens naast elkaar.+
De modellen gebruiken verschillende openbare bewijsschalen. Ontbrekend bewijs wordt niet als nul behandeld en OpenGPT combineert ongelijksoortige bronnen niet tot één score.
Claims over contextvensters tonen geen ophaalkwaliteit of getrouw gebruik van een lang document aan.
De evaluatie opent met dit taaksjabloon en de eerste twee geselecteerde modellen. U kunt elke taak bewerken voordat u antwoorden verzamelt.