METHODOLOGIE VAN DE AI-BESLISSINGSWERKRUIMTE

Bekijk hoe een aanbeveling een beslissing wordt.

OpenGPT is een AI-beslissingswerkruimte. Het houdt redactionele afstemming op vereisten, feitelijke bronrecords, evaluatie met echte taken en gepubliceerd benchmarkbewijs gescheiden, zodat elk resultaat zijn voorwaarden en beperkingen kan tonen.

De methode in één minuut

  • Een rangschikking is relatief ten opzichte van één specifieke bron en reikwijdte; het is geen universele score.
  • Exacte modelversies en volledige Agent-configuraties vormen de vergelijkingseenheid.
  • Onbekende of onverenigbare gegevens blijven onbekend in plaats van nul of één gecombineerde ranglijst te worden.
  • Lokale rapportcontroles bewijzen structuur en interne consistentie, niet de herkomst van uitvoer of authenticiteit van de provider.

Redactionele geschiktheidsscores · editorial-fit-v1

Hoe redactionele geschiktheidsscores van 0–10 worden toegekend

Deze acht catalogussignalen ondersteunen vergelijking per categorie. Ze vormen een gedocumenteerde redactionele oordeelslaag van OpenGPT, los van rules-v2-aanbevelingspunten en openbaar benchmarkbewijs.

Redactionele productgeschiktheidsscore: 10 duidt op een betere geschiktheid voor de genoemde dimensie; dimensies worden gelijkwaardig weergegeven en nooit tot één algehele winnaar gecombineerd.

Intelligentie

0–10

Redactionele geschiktheid voor breed, complex algemeen werk op basis van gedocumenteerde mogelijkheden, catalogusrol en bekende productbeperkingen — geen IQ- of benchmarkscore.

Programmeren

0–10

Redactionele geschiktheid voor softwareplanning, implementatie, foutopsporing, beoordeling en repositoryworkflows; dit is geen gemeten slagingspercentage.

Redeneren

0–10

Redactionele geschiktheid voor meerstapsanalyse, omgaan met beperkingen en gestructureerd problemen oplossen — geen gereproduceerde redeneerbenchmark.

Schrijven

0–10

Redactionele geschiktheid voor opstellen, bewerken, lange teksten en documentatieworkflows — geen gemeten resultaat voor stijl of feitelijke juistheid.

Snelheid

0–10

Redactionele geschiktheid voor snelle iteratie op basis van productpositionering en leveringsmodus — geen claim over gemeten latentie.

Kostenefficiëntie

0–10

Redactionele geschiktheid voor beheersing van toegangsprijzen en operationele kosten op basis van vermelde niveaus en implementatiemodus; dit is geen berekening van de totale kosten of prijsgarantie.

Privacycontrole

0–10

Redactionele geschiktheid voor controle over implementatie en gegevens op basis van een lokale, hybride of cloudclassificatie; dit is geen audit van beveiliging, naleving of telemetrie.

Ecosysteem

0–10

Redactionele geschiktheid voor beschikbare hulpmiddelen, integraties, platforms en implementatieopties — geen meting van marktaandeel of integratiekwaliteit.

Gewichten en aggregatie

Elke dimensie krijgt evenveel nadruk in de weergave. Er is geen rekenkundig gewicht, gemiddelde, totaalscore of algehele winnaar; de gebruiker bepaalt welke dimensies voor de opgegeven voorwaarden van belang zijn.

Menselijke redactionele grens

Redacteuren kennen op basis van de beoordelingscriteria, door de provider bevestigde productfeiten en catalogusclassificaties gehele geschiktheidsscores van 0–10 toe. Een score is geen meting van een exacte versie, benchmarkresultaat, waarschijnlijkheid of providergarantie.

Bronnen

Officiële providerpagina's onderbouwen identiteit, toegang, gepubliceerde mogelijkheden, implementatieopties en vermelde prijzen. De beste-voor-tags, sterke en zwakke punten, classificaties en alle waarden van 0–10 van OpenGPT zijn redactionele invoer.

Catalogusbeoordeling

Catalogus laatst beoordeeld:

Betrouwbaarheid: Gemiddelde redactionele dekking

Vertrouwen beschrijft de volledigheid van catalogusdekking en uitleg, niet de waarschijnlijkheid van goede prestaties. Providergegevens kunnen veranderen en het geschiktheidssignaal is niet onafhankelijk gemeten.

Toepasbaarheid

Gebruik de scores om catalogusitems op de genoemde dimensie te vergelijken onder de Actuele product- en implementatieaannames. Vergelijk scoreverschillen niet als gemeten prestatieverschillen.

Controleer vóór ingebruikname de actuele providergegevens en test de exacte modelversie, servicelaag, tools, regio en representatief werk.

Gepubliceerde methode · rules-v2

Hoe OpenGPT-aanbevelingen tot stand komen

De Builder zet een lokaal profiel om in een deterministische shortlist. De onderstaande punten rangschikken redactionele productgeschiktheid na harde budget- en privacydrempels; ze meten geen modelkwaliteit.

Scoringsdimensies en optelbare regelpunten

Punten zijn voorwaardelijke gewichten, geen percentages. Een harde drempel verwijdert een ongeschikt item vóór het scoren.

Geschiktheid voor taak en doel

Model · Tool

Modellen krijgen +12 voor elke geselecteerde taakmatch en +10 voor een exacte doelmatch. Hulpmiddelen krijgen +10 voor elke geselecteerde gebruikssituatiematch.

User-declared conditions · OpenGPT editorial catalog

Privacy en implementatie

Model · Tool

Hoge privacy sluit niet-lokale modellen en hulpmiddelen uit die niet als zeer privacyvriendelijk zijn geclassificeerd. Geschikte lokale modellen krijgen +30 en hulpmiddelen met hoge privacy +12. Voor gemiddelde privacy krijgen hybride/lokale/cloudmodellen +8/+5/+2.

User-declared conditions · OpenGPT editorial catalog

Budgetgeschiktheid

Model · Tool

Items buiten de geselecteerde band voor vermelde prijzen worden uitgesloten. Geschikte modellen krijgen +12 en hulpmiddelen +8; een model met gratis profiel en een vermelde gratis instapmogelijkheid krijgt nog eens +16.

User-declared conditions · Provider-published facts · OpenGPT editorial catalog

Geschiktheid voor beroepsrol

Model · Tool

Studentmodelmatches krijgen +10; andere ondersteunde modelrolmatches +8. Studenttoolmatches krijgen +8; andere ondersteunde toolrolmatches +6.

User-declared conditions · OpenGPT editorial catalog

Branchesignalen

Model · Tool

Herkende branchetermen worden aan taakcategorieën gekoppeld. Modellen krijgen +5 en hulpmiddelen +4 voor elke gekoppelde taakmatch. De vrije tekst zelf wordt niet naar de workflow gekopieerd.

User-declared conditions · OpenGPT editorial catalog

Taalgeschiktheid

Model

Bij een niet-Engelse voorkeur krijgt een passende meertalige catalogusvermelding +14 en een niet-passende −3. Voor Engels krijgt geschiktheid voor schrijfwerk of documentatie +3.

User-declared conditions · OpenGPT editorial catalog

Platformgeschiktheid

Model · Tool

Een modelmatch krijgt voor Web +3, Desktop +10, Terminal +8, API +7 en Mobiel +9. Hulpmiddelen krijgen +7 per platformmatch of −3 als niets overeenkomt.

User-declared conditions · OpenGPT editorial catalog

Passend bij ervaring

Model · Tool

Geschiktheid voor beginnersmodellen is +10 (of −4 bij een mismatch met een lokaal model), geavanceerde geschiktheid +7 en geschiktheid voor tussenliggende frontier-/hybridemodellen +2. Geschiktheid van tools voor beginners/geavanceerden is +6/+5.

User-declared conditions · OpenGPT editorial catalog

Selectie en gelijke standen

Model · Tool

Geschikte kandidaten worden gesorteerd op regelpunten; bij gelijke scores bepaalt de naam de volgorde. Rollen worden in een vaste volgorde ingevuld en maximaal drie resterende passende modellen worden alternatieven.

Deterministische rules-v2

Bronnen en claimgrenzen

Feitelijke bron

Door provider gepubliceerde feiten

Officiële providerpagina's onderbouwen identiteit, toegang, gepubliceerde beschrijvingen van mogelijkheden en vermelde prijzen. OpenGPT beschouwt deze pagina's niet als onafhankelijke prestatietests.

Redactioneel oordeel

Redactionele OpenGPT-catalogus

Labels voor beste toepassingen, sterke punten, privacy-/implementatieclassificaties en signalen voor productgeschiktheid zijn beoordeelde redactionele oordelen. Het zijn geen benchmarkmetingen of garanties van providers.

Door gebruiker opgegeven voorwaarde

Door gebruiker opgegeven voorwaarden

Doel, taken, rol, budget, privacy, taal, platform, vaardigheid en branchesignalen komen uit het lokale profiel van de gebruiker. Ze beschrijven toepasbaarheid, geen extern bewijs.

Mechanische regel

Deterministische rules-v2

Hetzelfde genormaliseerde profiel en dezelfde catalogusmomentopname leveren dezelfde volgorde op. De rekenkundige bewerking is uitlegbaar, maar determinisme maakt redactionele invoer niet feitelijk.

Alleen context

Openbare benchmarkcontext

Openbare ranglijsten blijven afzonderlijk bewijs. rules-v2 voegt geen benchmarkposities of -scores toe aan aanbevelingspunten; gebruik ze na de shortlist en behoud het bereik van elke bron.

Feitelijk versus redactioneel

Feitelijke bron

Feitelijke claims moeten te herleiden zijn tot een genoemde provider- of benchmarkbron, waar beschikbaar een exacte identiteit en een beoordelingsdatum.

Redactioneel oordeel

Geschiktheidstags, sterke punten, classificaties, aannames, betrouwbaarheid en aanbevelingen zijn redactionele oordelen van OpenGPT. Ze mogen niet als gemeten resultaten van exacte versies worden gepresenteerd.

Beoordelingsritme en betrouwbaarheid

Methodologie en actieve aanbevelingsrecords worden ten minste elke 90 dagen en daarnaast op basis van gebeurtenissen beoordeeld. Elk resultaat moet de beoordelingsdatum van het eigen record gebruiken — niet de datum van deze pagina.

Beoordeling wordt geactiveerd wanneer

  • Een aanbieder wijzigt een model (ID), de levenscyclus, het toegangspad, de capaciteitsbeschrijving of de vermelde prijs.
  • De aanbevelingsengine, gewichten, harde drempels of redactionele taxonomie verandert.
  • Een correctie heeft betrekking op een wezenlijke fout in de bron, identiteit, prijsstelling, privacy of toepasbaarheid.

Vertrouwensregels

Vertrouwen beschrijft de volledigheid van de geschiktheidsuitleg en het ondersteunende record. Het is geen waarschijnlijkheid dat het model goed presteert.

Hoog
De exacte identiteit en een actuele feitelijke bron zijn aanwezig; belangrijke velden zijn ingevuld, aannames zijn zichtbaar en er wordt een geschikt alternatief genoemd.
Gemiddeld
De match is uitlegbaar, maar één bron, voorwaarde of Actueel feit moet vóór ingebruikname worden bevestigd.
Laag
Identiteit, actualiteit, prijs, privacy of toepasbaarheid vertoont een belangrijk hiaat. Beschouw het item alleen als kandidaat om te onderzoeken.

Toepasbaarheid en voorwaarden

  • Van toepassing op de redactionele shortlist (rules-v2) die is gegenereerd op basis van de huidige beoordeelde model- en toolcatalogus.
  • Het resultaat is afhankelijk van het ingediende profiel en de catalogusmomentopname; wijzig een van beide en het resultaat kan veranderen.
  • Dit is een hulpmiddel voor beslissingen met weinig risico, geen bewijs van kwaliteit, actuele prijs, benchmarkleiderschap, veiligheid, rechtmatigheid of geschiktheid voor gereguleerd gebruik.

Vereiste auditweergave per resultaat

Een geïntegreerde aanbeveling moet alle zeven onderstaande velden weergeven, zonder dat de gebruiker zelf de reikwijdte van het bewijs hoeft af te leiden.

  1. Waarom
  2. Bewijs
  3. Aannames
  4. Laatst beoordeeld
  5. Betrouwbaarheid
  6. Beste alternatief
  7. Wanneer niet kiezen

Van een echte taak naar een controleerbare conclusie

1

Definieer de test

Leg vóór de vergelijking de taak, succescriteria, invoer, beperkingen, exacte modelversies, instellingen en datum vast.

2

Gebruik dezelfde voorwaarden

Geef elke kandidaat dezelfde taak en beoordelingscriteria. Verborgen labels verminderen vertekening door zichtbare namen, maar dit is geen dubbelblinde of onafhankelijk uitgevoerde test.

3

Behoud de brongegevens

Sla prompts, antwoorden, scores, fouten, latentie en hashes op. Vul ontbrekend bewijs niet aan met ramingen.

4

Vermeld de beperkingen

Toon onzekerheid, steekproefgrootte, uitsluitingen, conflicten en wat het resultaat niet bewijst.

Bewijsniveaus

Evidence v1/v2 controleert de bestandsindeling en consistentie van verklaringen. Beslissingswerkruimte V3 berekent ook hashes, toewijzingen, koppelingen, scores en samenvattingen opnieuw uit de opgeslagen invoer. Dit bewijst geen onafhankelijke reproductie op L4.

L1Supported now

Indeling gecontroleerd

Het bestand volgt het opgegeven schema en bevat geen duidelijke velden met geheimen.

L2Partially supported

Record voltooid

Het doel is een consistent record van taken, instellingen, modelverklaringen en evaluatiedatum. V1 controleert slechts een deel van dit record.

L3Supported for V3

Herberekenbaar

Beslissingswerkruimte V3 bevat ruwe geplakte uitvoer en score-invoer voor strikte lokale herberekening; Evidence v1/v2 bevat niet dezelfde velden.

L4Not yet supported

Onafhankelijk gereproduceerd

Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.

Hoe ranglijsten van AI-agenten worden vergeleken

Elke rij vertegenwoordigt één gepubliceerde agentconfiguratie binnen het genoemde bereik van een benchmark. Het is niet alleen een score voor het basismodel.

Systeemconfiguraties vergelijken

Houd alle door de bron gepubliceerde velden voor agent, basismodel, scaffold, hulpmiddel, omgeving, budget en datum bij elkaar; markeer niet-gerapporteerde velden als onbekend.

Oorspronkelijke schalen behouden

Rangschik alleen binnen dezelfde benchmark, versie, taakregels en vergelijkbare uitvoeringsgroep. OpenGPT maakt geen universele score over benchmarks heen.

Noem de bewijsstatus

Maak onderscheid tussen records van benchmarkuitgevers, upstream gecontroleerde inzendingen, providerreports en community-uitvoeringen.

Behoud operationeel bewijs

Toon kosten, latentie, stappen en menselijke tussenkomst wanneer de bron vergelijkbare waarden levert; laat ontbrekende waarden onbekend.

Wat lokale validatie kan vaststellen

  • Vereiste velden en ondersteunde gegevenstypen
  • Interne consistentie van scores, uitvoeringen, datums en hashes
  • Of het pakket demogegevens opgeeft
  • Ontbreken van de gemeenschappelijke API-sleutel en geheime velden

Wat dit niet zelfstandig kan vaststellen

  • Dat de opgegeven provider of het opgegeven model de uitvoer daadwerkelijk heeft geproduceerd
  • Dat een score vrij is van selectiebias of een zwak testontwerp
  • Dat één resultaat op elke taak, taal, gebruiker of toekomstige modelversie van toepassing is
  • Dat een model veilig, rechtmatig of geschikt is voor een beslissing met grote gevolgen

Publicatieprincipes

Niet betalen voor een rangschikking

Sponsoring kan worden vermeld, maar mag scores, bewijsdrempels of plaatsing niet wijzigen.

Versies, geen merknamen

Een modelreeks is geen stabiel testobject. Exacte model-ID's, instellingen, regio en datum zijn van belang.

Echte taken vóór brede claims

OpenGPT beveelt shortlists aan op basis van vereisten en vraagt gebruikers vervolgens hun eigen representatieve werk te testen.

Onzekerheid is een resultaat

Gelijke standen, kleine steekproeven, mislukte uitvoeringen en bewijs zonder uitsluitsel moeten zichtbaar blijven.