Bekijk hoe een aanbeveling een beslissing wordt.
OpenGPT is een AI-beslissingswerkruimte. Het houdt redactionele afstemming op vereisten, feitelijke bronrecords, evaluatie met echte taken en gepubliceerd benchmarkbewijs gescheiden, zodat elk resultaat zijn voorwaarden en beperkingen kan tonen.
De methode in één minuut
- Een rangschikking is relatief ten opzichte van één specifieke bron en reikwijdte; het is geen universele score.
- Exacte modelversies en volledige Agent-configuraties vormen de vergelijkingseenheid.
- Onbekende of onverenigbare gegevens blijven onbekend in plaats van nul of één gecombineerde ranglijst te worden.
- Lokale rapportcontroles bewijzen structuur en interne consistentie, niet de herkomst van uitvoer of authenticiteit van de provider.
Redactionele geschiktheidsscores · editorial-fit-v1
Hoe redactionele geschiktheidsscores van 0–10 worden toegekend
Deze acht catalogussignalen ondersteunen vergelijking per categorie. Ze vormen een gedocumenteerde redactionele oordeelslaag van OpenGPT, los van rules-v2-aanbevelingspunten en openbaar benchmarkbewijs.
Redactionele productgeschiktheidsscore: 10 duidt op een betere geschiktheid voor de genoemde dimensie; dimensies worden gelijkwaardig weergegeven en nooit tot één algehele winnaar gecombineerd.
Intelligentie
0–10Redactionele geschiktheid voor breed, complex algemeen werk op basis van gedocumenteerde mogelijkheden, catalogusrol en bekende productbeperkingen — geen IQ- of benchmarkscore.
Programmeren
0–10Redactionele geschiktheid voor softwareplanning, implementatie, foutopsporing, beoordeling en repositoryworkflows; dit is geen gemeten slagingspercentage.
Redeneren
0–10Redactionele geschiktheid voor meerstapsanalyse, omgaan met beperkingen en gestructureerd problemen oplossen — geen gereproduceerde redeneerbenchmark.
Schrijven
0–10Redactionele geschiktheid voor opstellen, bewerken, lange teksten en documentatieworkflows — geen gemeten resultaat voor stijl of feitelijke juistheid.
Snelheid
0–10Redactionele geschiktheid voor snelle iteratie op basis van productpositionering en leveringsmodus — geen claim over gemeten latentie.
Kostenefficiëntie
0–10Redactionele geschiktheid voor beheersing van toegangsprijzen en operationele kosten op basis van vermelde niveaus en implementatiemodus; dit is geen berekening van de totale kosten of prijsgarantie.
Privacycontrole
0–10Redactionele geschiktheid voor controle over implementatie en gegevens op basis van een lokale, hybride of cloudclassificatie; dit is geen audit van beveiliging, naleving of telemetrie.
Ecosysteem
0–10Redactionele geschiktheid voor beschikbare hulpmiddelen, integraties, platforms en implementatieopties — geen meting van marktaandeel of integratiekwaliteit.
Gewichten en aggregatie
Elke dimensie krijgt evenveel nadruk in de weergave. Er is geen rekenkundig gewicht, gemiddelde, totaalscore of algehele winnaar; de gebruiker bepaalt welke dimensies voor de opgegeven voorwaarden van belang zijn.
Menselijke redactionele grens
Redacteuren kennen op basis van de beoordelingscriteria, door de provider bevestigde productfeiten en catalogusclassificaties gehele geschiktheidsscores van 0–10 toe. Een score is geen meting van een exacte versie, benchmarkresultaat, waarschijnlijkheid of providergarantie.
Bronnen
Officiële providerpagina's onderbouwen identiteit, toegang, gepubliceerde mogelijkheden, implementatieopties en vermelde prijzen. De beste-voor-tags, sterke en zwakke punten, classificaties en alle waarden van 0–10 van OpenGPT zijn redactionele invoer.
Catalogusbeoordeling
Catalogus laatst beoordeeld:
Betrouwbaarheid: Gemiddelde redactionele dekking
Vertrouwen beschrijft de volledigheid van catalogusdekking en uitleg, niet de waarschijnlijkheid van goede prestaties. Providergegevens kunnen veranderen en het geschiktheidssignaal is niet onafhankelijk gemeten.
Toepasbaarheid
Gebruik de scores om catalogusitems op de genoemde dimensie te vergelijken onder de Actuele product- en implementatieaannames. Vergelijk scoreverschillen niet als gemeten prestatieverschillen.
Controleer vóór ingebruikname de actuele providergegevens en test de exacte modelversie, servicelaag, tools, regio en representatief werk.
Gepubliceerde methode · rules-v2
Hoe OpenGPT-aanbevelingen tot stand komen
De Builder zet een lokaal profiel om in een deterministische shortlist. De onderstaande punten rangschikken redactionele productgeschiktheid na harde budget- en privacydrempels; ze meten geen modelkwaliteit.
Scoringsdimensies en optelbare regelpunten
Punten zijn voorwaardelijke gewichten, geen percentages. Een harde drempel verwijdert een ongeschikt item vóór het scoren.
Geschiktheid voor taak en doel
Model · ToolModellen krijgen +12 voor elke geselecteerde taakmatch en +10 voor een exacte doelmatch. Hulpmiddelen krijgen +10 voor elke geselecteerde gebruikssituatiematch.
User-declared conditions · OpenGPT editorial catalogPrivacy en implementatie
Model · ToolHoge privacy sluit niet-lokale modellen en hulpmiddelen uit die niet als zeer privacyvriendelijk zijn geclassificeerd. Geschikte lokale modellen krijgen +30 en hulpmiddelen met hoge privacy +12. Voor gemiddelde privacy krijgen hybride/lokale/cloudmodellen +8/+5/+2.
User-declared conditions · OpenGPT editorial catalogBudgetgeschiktheid
Model · ToolItems buiten de geselecteerde band voor vermelde prijzen worden uitgesloten. Geschikte modellen krijgen +12 en hulpmiddelen +8; een model met gratis profiel en een vermelde gratis instapmogelijkheid krijgt nog eens +16.
User-declared conditions · Provider-published facts · OpenGPT editorial catalogGeschiktheid voor beroepsrol
Model · ToolStudentmodelmatches krijgen +10; andere ondersteunde modelrolmatches +8. Studenttoolmatches krijgen +8; andere ondersteunde toolrolmatches +6.
User-declared conditions · OpenGPT editorial catalogBranchesignalen
Model · ToolHerkende branchetermen worden aan taakcategorieën gekoppeld. Modellen krijgen +5 en hulpmiddelen +4 voor elke gekoppelde taakmatch. De vrije tekst zelf wordt niet naar de workflow gekopieerd.
User-declared conditions · OpenGPT editorial catalogTaalgeschiktheid
ModelBij een niet-Engelse voorkeur krijgt een passende meertalige catalogusvermelding +14 en een niet-passende −3. Voor Engels krijgt geschiktheid voor schrijfwerk of documentatie +3.
User-declared conditions · OpenGPT editorial catalogPlatformgeschiktheid
Model · ToolEen modelmatch krijgt voor Web +3, Desktop +10, Terminal +8, API +7 en Mobiel +9. Hulpmiddelen krijgen +7 per platformmatch of −3 als niets overeenkomt.
User-declared conditions · OpenGPT editorial catalogPassend bij ervaring
Model · ToolGeschiktheid voor beginnersmodellen is +10 (of −4 bij een mismatch met een lokaal model), geavanceerde geschiktheid +7 en geschiktheid voor tussenliggende frontier-/hybridemodellen +2. Geschiktheid van tools voor beginners/geavanceerden is +6/+5.
User-declared conditions · OpenGPT editorial catalogSelectie en gelijke standen
Model · ToolGeschikte kandidaten worden gesorteerd op regelpunten; bij gelijke scores bepaalt de naam de volgorde. Rollen worden in een vaste volgorde ingevuld en maximaal drie resterende passende modellen worden alternatieven.
Deterministische rules-v2Bronnen en claimgrenzen
Door provider gepubliceerde feiten
Officiële providerpagina's onderbouwen identiteit, toegang, gepubliceerde beschrijvingen van mogelijkheden en vermelde prijzen. OpenGPT beschouwt deze pagina's niet als onafhankelijke prestatietests.
Redactionele OpenGPT-catalogus
Labels voor beste toepassingen, sterke punten, privacy-/implementatieclassificaties en signalen voor productgeschiktheid zijn beoordeelde redactionele oordelen. Het zijn geen benchmarkmetingen of garanties van providers.
Door gebruiker opgegeven voorwaarden
Doel, taken, rol, budget, privacy, taal, platform, vaardigheid en branchesignalen komen uit het lokale profiel van de gebruiker. Ze beschrijven toepasbaarheid, geen extern bewijs.
Deterministische rules-v2
Hetzelfde genormaliseerde profiel en dezelfde catalogusmomentopname leveren dezelfde volgorde op. De rekenkundige bewerking is uitlegbaar, maar determinisme maakt redactionele invoer niet feitelijk.
Openbare benchmarkcontext
Openbare ranglijsten blijven afzonderlijk bewijs. rules-v2 voegt geen benchmarkposities of -scores toe aan aanbevelingspunten; gebruik ze na de shortlist en behoud het bereik van elke bron.
Feitelijk versus redactioneel
Feitelijke claims moeten te herleiden zijn tot een genoemde provider- of benchmarkbron, waar beschikbaar een exacte identiteit en een beoordelingsdatum.
Geschiktheidstags, sterke punten, classificaties, aannames, betrouwbaarheid en aanbevelingen zijn redactionele oordelen van OpenGPT. Ze mogen niet als gemeten resultaten van exacte versies worden gepresenteerd.
Beoordelingsritme en betrouwbaarheid
Methodologie en actieve aanbevelingsrecords worden ten minste elke 90 dagen en daarnaast op basis van gebeurtenissen beoordeeld. Elk resultaat moet de beoordelingsdatum van het eigen record gebruiken — niet de datum van deze pagina.
Beoordeling wordt geactiveerd wanneer
- Een aanbieder wijzigt een model (ID), de levenscyclus, het toegangspad, de capaciteitsbeschrijving of de vermelde prijs.
- De aanbevelingsengine, gewichten, harde drempels of redactionele taxonomie verandert.
- Een correctie heeft betrekking op een wezenlijke fout in de bron, identiteit, prijsstelling, privacy of toepasbaarheid.
Vertrouwensregels
Vertrouwen beschrijft de volledigheid van de geschiktheidsuitleg en het ondersteunende record. Het is geen waarschijnlijkheid dat het model goed presteert.
- Hoog
- De exacte identiteit en een actuele feitelijke bron zijn aanwezig; belangrijke velden zijn ingevuld, aannames zijn zichtbaar en er wordt een geschikt alternatief genoemd.
- Gemiddeld
- De match is uitlegbaar, maar één bron, voorwaarde of Actueel feit moet vóór ingebruikname worden bevestigd.
- Laag
- Identiteit, actualiteit, prijs, privacy of toepasbaarheid vertoont een belangrijk hiaat. Beschouw het item alleen als kandidaat om te onderzoeken.
Toepasbaarheid en voorwaarden
- Van toepassing op de redactionele shortlist (rules-v2) die is gegenereerd op basis van de huidige beoordeelde model- en toolcatalogus.
- Het resultaat is afhankelijk van het ingediende profiel en de catalogusmomentopname; wijzig een van beide en het resultaat kan veranderen.
- Dit is een hulpmiddel voor beslissingen met weinig risico, geen bewijs van kwaliteit, actuele prijs, benchmarkleiderschap, veiligheid, rechtmatigheid of geschiktheid voor gereguleerd gebruik.
Vereiste auditweergave per resultaat
Een geïntegreerde aanbeveling moet alle zeven onderstaande velden weergeven, zonder dat de gebruiker zelf de reikwijdte van het bewijs hoeft af te leiden.
- Waarom
- Bewijs
- Aannames
- Laatst beoordeeld
- Betrouwbaarheid
- Beste alternatief
- Wanneer niet kiezen
Van een echte taak naar een controleerbare conclusie
Definieer de test
Leg vóór de vergelijking de taak, succescriteria, invoer, beperkingen, exacte modelversies, instellingen en datum vast.
Gebruik dezelfde voorwaarden
Geef elke kandidaat dezelfde taak en beoordelingscriteria. Verborgen labels verminderen vertekening door zichtbare namen, maar dit is geen dubbelblinde of onafhankelijk uitgevoerde test.
Behoud de brongegevens
Sla prompts, antwoorden, scores, fouten, latentie en hashes op. Vul ontbrekend bewijs niet aan met ramingen.
Vermeld de beperkingen
Toon onzekerheid, steekproefgrootte, uitsluitingen, conflicten en wat het resultaat niet bewijst.
Bewijsniveaus
Evidence v1/v2 controleert de bestandsindeling en consistentie van verklaringen. Beslissingswerkruimte V3 berekent ook hashes, toewijzingen, koppelingen, scores en samenvattingen opnieuw uit de opgeslagen invoer. Dit bewijst geen onafhankelijke reproductie op L4.
Indeling gecontroleerd
Het bestand volgt het opgegeven schema en bevat geen duidelijke velden met geheimen.
Record voltooid
Het doel is een consistent record van taken, instellingen, modelverklaringen en evaluatiedatum. V1 controleert slechts een deel van dit record.
Herberekenbaar
Beslissingswerkruimte V3 bevat ruwe geplakte uitvoer en score-invoer voor strikte lokale herberekening; Evidence v1/v2 bevat niet dezelfde velden.
Onafhankelijk gereproduceerd
Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.
Hoe ranglijsten van AI-agenten worden vergeleken
Elke rij vertegenwoordigt één gepubliceerde agentconfiguratie binnen het genoemde bereik van een benchmark. Het is niet alleen een score voor het basismodel.
Systeemconfiguraties vergelijken
Houd alle door de bron gepubliceerde velden voor agent, basismodel, scaffold, hulpmiddel, omgeving, budget en datum bij elkaar; markeer niet-gerapporteerde velden als onbekend.
Oorspronkelijke schalen behouden
Rangschik alleen binnen dezelfde benchmark, versie, taakregels en vergelijkbare uitvoeringsgroep. OpenGPT maakt geen universele score over benchmarks heen.
Noem de bewijsstatus
Maak onderscheid tussen records van benchmarkuitgevers, upstream gecontroleerde inzendingen, providerreports en community-uitvoeringen.
Behoud operationeel bewijs
Toon kosten, latentie, stappen en menselijke tussenkomst wanneer de bron vergelijkbare waarden levert; laat ontbrekende waarden onbekend.
Wat lokale validatie kan vaststellen
- ✓Vereiste velden en ondersteunde gegevenstypen
- ✓Interne consistentie van scores, uitvoeringen, datums en hashes
- ✓Of het pakket demogegevens opgeeft
- ✓Ontbreken van de gemeenschappelijke API-sleutel en geheime velden
Wat dit niet zelfstandig kan vaststellen
- —Dat de opgegeven provider of het opgegeven model de uitvoer daadwerkelijk heeft geproduceerd
- —Dat een score vrij is van selectiebias of een zwak testontwerp
- —Dat één resultaat op elke taak, taal, gebruiker of toekomstige modelversie van toepassing is
- —Dat een model veilig, rechtmatig of geschikt is voor een beslissing met grote gevolgen
Publicatieprincipes
Niet betalen voor een rangschikking
Sponsoring kan worden vermeld, maar mag scores, bewijsdrempels of plaatsing niet wijzigen.
Versies, geen merknamen
Een modelreeks is geen stabiel testobject. Exacte model-ID's, instellingen, regio en datum zijn van belang.
Echte taken vóór brede claims
OpenGPT beveelt shortlists aan op basis van vereisten en vraagt gebruikers vervolgens hun eigen representatieve werk te testen.
Onzekerheid is een resultaat
Gelijke standen, kleine steekproeven, mislukte uitvoeringen en bewijs zonder uitsluitsel moeten zichtbaar blijven.