HANDLEIDINGEN EN ONDERSTEUNING

OpenGPT-helpcentrum

Zoek de juiste workflow, volg elke stap en begrijp wat het resultaat u wel en niet kan vertellen.

Begin met wat u wilt doen

Elke workflow beantwoordt een andere vraag. Begin met het dichtstbijzijnde doel en volg daarna de gekoppelde handleiding.

1ModelranglijstenGepubliceerde signalen en identiteitsstatus begrijpen.2AgentrangschikkingenKies volledige agentconfiguraties op basis van taak en bewijs.3KiezenBeperk kandidaten op basis van echte vereisten.4Openbare gegevens vergelijkenPlaats twee tot vier catalogusmodel-ID's naast elkaar.5Modellen opslaanBewaar een lokale shortlist in deze browser.6Een Proof Lab-proef uitvoerenTest 2–4 exacte model- van Agent-configuraties met één bevroren takenpakket.7Bewijs indienen van corrigerenStuur een openbare model- van Agent-bron voor redactionele beoordeling.8Een rapport verifiërenControleer vóór het delen lokaal een OpenGPT-JSON-rapport.

01

AI Modelrangschikkingen

Bekijk wat is gerangschikt, waar de gegevens vandaan komen en welke records een officiële model-ID bevatten.

Openen

Waarvoor deze functie bedoeld is

Gebruik elke invalshoek van de ranglijst om gepubliceerde signalen te bekijken, bronrecords te beoordelen en een shortlist voor tests met echte taken op te bouwen.

Voordat u begint

Begin met de vraag die u moet beantwoorden. Gebruikersvoorkeur, algehele mogelijkheden, objectieve taken, kosten en ranglijsten voor open gewichten gebruiken verschillende bronnen en schalen.

Stapsgewijze zelfstudie

  1. 1Kies het ranglijstperspectief dat bij uw beslissing past.
  2. 2Gebruik Volledige bronranglijst voor elk uitgeversrecord van Officiële model-ID's voor records die door providerdocumentatie zijn gekoppeld.
  3. 3Lees bronpositie, scorebereik, stemmen, licentie en configuratie samen.
  4. 4Open Modeldetails in een willekeurige rij. Exacte officiële koppelingen gebruiken het officiële profiel; elke andere rij opent een bronprofiel waarin de gepubliceerde naam en configuratie behouden blijven.
  5. 5Voeg een willekeurige rij toe aan de vergelijking. Bij exacte, configuratieveilige toewijzingen wordt de officiële versie vergeleken; bij alle andere rijen wordt het bronrecord vergeleken binnen dezelfde bron, dimensie en snapshot.

Zo leest u het resultaat

Een rangschikking is relatief ten opzichte van één bron en reikwijdte. Bij gelijke standen kunnen rangnummers worden overgeslagen, en scores vanuit verschillende invalshoeken zijn niet direct vergelijkbaar.

Wat dit niet kan bewijzen

OpenGPT ordent openbare gegevens van derden en heeft deze evaluaties niet opnieuw uitgevoerd. Geen ranglijst wijst het beste model voor elke gebruiker van taak aan.

Veelgestelde vraag: Waarom tonen sommige rijen alleen een model-ID van naam uit de bron?

Elke rij bevat nu modeldetails en een vergelijkingsactie. OpenGPT voegt alleen een officiële model-ID toe wanneer providerdocumentatie de exacte koppeling bewijst; anders behoudt de vergelijking van bronrecords de naam, configuratie en rangschikkingsgegevens van de uitgever zonder een nieuwe officiële ID te verzinnen.

Terug naar boven
02

AI Agent-rangschikkingen

Kies een agent op basis van taak, volledige configuratie, bewijskwaliteit en vergelijkbare resultaten.

Openen

Waarvoor deze functie bedoeld is

Verken 96 gepubliceerde Agent-evaluatieconfiguraties in zeven taakbereiken, plus 109 afzonderlijke BFCL-resultaten voor toolgebruik, zonder onverenigbaar bewijs tot één score samen te voegen.

Voordat u begint

Een agentresultaat hoort bij één volledige configuratie: basismodel, scaffold, tools, rechten, budget, omgeving, benchmarkversie en datum. OpenGPT behoudt de velden die door de bron zijn gerapporteerd en laat ontbrekende velden ongerapporteerd (dus niet op nul staan).

Stapsgewijze zelfstudie

  1. 1Kies de taakcategorie die bij uw werk past.
  2. 2Controleer het benchmarkbereik, de versie, evaluatiedatum, actualiteit en auditnotitie voordat u de positie interpreteert.
  3. 3Gebruik de bewijskwaliteit om gereproduceerde van gecontroleerde resultaten te onderscheiden van transparante openbare uitvoeringen en door leveranciers gerapporteerde resultaten.
  4. 4Vergelijk succes, bewijs uit herhaalde uitvoeringen, duur en interventie alleen wanneer de bron deze onder dezelfde omstandigheden rapporteert. OpenGPT toont kosten per succes alleen wanneer het gepubliceerde totaal en de noemer van taken/uitvoeringen hetzelfde geverifieerde bereik gebruiken.
  5. 5Volg nuttige configuraties, bekijk hun geschiedenis en selecteer twee tot vier items uit dezelfde vergelijkbare groep voor een weergave naast elkaar.

Zo leest u het resultaat

Een rangschikking beschrijft één volledige systeemconfiguratie binnen het bereik van één benchmark. Bekijk deze in samenhang met de bewijskwaliteit, actualiteit, het aantal steekproeven van uitvoeringen en eventuele gerapporteerde gegevens over kosten en betrouwbaarheid.

Wat dit niet kan bewijzen

OpenGPT maakt geen universele Agent-score. Tenzij een resultaat expliciet als gereproduceerd is gemarkeerd, ordent OpenGPT upstream-bewijs in plaats van de evaluatie opnieuw uit te voeren; geen benchmark bewijst productiegereedheid voor elke workflow.

Veelgestelde vraag: Waarom kan dezelfde agent van hetzelfde model meer dan eens verschijnen?

Een ander scaffold, modelversie, toolset, toestemmingsniveau, budget van benchmarkinstelling leidt tot een andere agentconfiguratie en moet als apart record behouden blijven.

Terug naar boven
03

Een model van Agent indienen

Stuur een openbare identiteits- van bewijsrecord ter beoordeling zonder de ranglijsten te wijzigen.

Openen

Waarvoor deze functie bedoeld is

Gebruik de inzendingsstroom wanneer een officiële model-ID van Agent-product ontbreekt van wanneer een openbare bron redactioneel moet worden beoordeeld.

Voordat u begint

Meld u aan met een geverifieerd account en bereid een openbare HTTPS-bron voor. Dien nooit inloggegevens, privébestanden van persoonsgegevens in.

Stapsgewijze zelfstudie

  1. 1Kies bovenaan het formulier Model van Agent.
  2. 2Voer de exacte openbare naam, provider van organisatie en de gevraagde identiteitsvelden in.
  3. 3Kies het brontype en link naar officiële documentatie, een openbare repository van een openbaar benchmarkresultaat.
  4. 4Leg uit wat de beoordelaar moet controleren en dien het vervolgens één keer in.
  5. 5Volg de beoordelingsstatus bij uw recente inzendingen. Een goedgekeurd Agent-product wordt automatisch in de doorzoekbare Agent-directory vermeld; rangschikking blijft afzonderlijk.

Zo leest u het resultaat

Een succesvolle inzending krijgt een referentienummer en komt in de beoordelingswachtrij terecht. Een goedgekeurd Agent-product is een record in een openbare gids, geen positie op een ranglijst van een goedkeuring (endorsement) voor OpenGPT.

Wat dit niet kan bewijzen

Inzenders kunnen rang, bewijskwaliteit, vergelijkbaarheid van publicatiestatus niet instellen. Duplicaat- en snelheidslimieten verminderen misbruik en goedkeuring verandert een ranglijst nooit automatisch.

Veelgestelde vraag: Waarom is een goedgekeurde inzending niet aan de ranglijst toegevoegd?

Goedgekeurde Agent-producten zijn doorzoekbaar in de directory, maar voor een ranglijst is nog steeds vergelijkbaar openbaar evaluatiebewijs vereist.

Terug naar boven
04

Ranglijstwijzigingen en versiegeschiedenis

Volg beweging tussen vergelijkbare momentopnamen en vergelijk catalogusmodel-ID's.

Openen

Waarvoor deze functie bedoeld is

Gebruik deze pagina om te zien wat sinds de vorige bronmomentopname is verschoven, welke records voor het eerst zijn verschenen, hoe exacte versies verschillen en wanneer gegevens zijn opgehaald.

Voordat u begint

Historische beweging gebruikt momenteel het LMArena-bereik voor gebruikersvoorkeuren. Andere actieve bronnen blijven alleen actueel totdat een vergelijkbare eerdere momentopname bestaat.

Stapsgewijze zelfstudie

  1. 1Controleer de brondatum, vergelijkingsbasislijn, ophaaldatum en vergelijkingsregel.
  2. 2Lees Snelste stijgers alleen voor records die in beide momentopnamen aanwezig zijn.
  3. 3Beschouw Voor het eerst verschenen als een nieuw bronitem — niet als officiële releasedatum.
  4. 4Filter de bewegingstabel op omhoog, omlaag, ongewijzigd, voor het eerst verschenen van niet meer vermeld.
  5. 5Vergelijk twee catalogusmodel-ID's en download daarna een bronsnapshot wanneer u een audittrail nodig hebt.

Zo leest u het resultaat

OpenGPT berekent beweging alleen wanneer bron, bereik, eenheid en methode overeenkomen en bewaart downloadbare maandelijkse momentopnamen.

Wat dit niet kan bewijzen

Alleen releasedatums die door de provider zijn gedocumenteerd, gelden als productreleases. Versievergelijking leidt snelheid, prijs, contextlengte van kwaliteit niet af uit namen.

Veelgestelde vraag: Waarom toont LiveBench geen positiebeweging?

OpenGPT heeft voor deze actieve bron geen vergelijkbare eerdere editie bevroren. Gepauzeerde bronnen blijven Historisch in plaats van bij te dragen aan Actuele beweging.

Terug naar boven
05

Ranglijsten per taak

Begin met een echt werkscenario en beoordeel drie officiële modelversies die het waard zijn om eerst te testen.

Openen

Waarvoor deze functie bedoeld is

Gebruik taakranglijsten om brede openbare signalen om te zetten in een kleine, praktische shortlist voor programmeren, onderzoek, documenten, ondersteuning, meertalig werk, multimodaal werk, kosten, privacy van snelheid.

Voordat u begint

Kies de taak die het dichtst bij uw werk ligt en noteer vervolgens uw werkelijke prompts, gegevens, tools, regio, budget en privacyvereisten. Het getoonde openbare bewijs kan een breder bereik hebben dan uw taak.

Stapsgewijze zelfstudie

  1. 1Open het taakscenario dat het dichtst aansluit bij de beslissing die u moet nemen.
  2. 2Lees waarom de drie officiële versies zijn geselecteerd en wat nog onzeker is.
  3. 3Bekijk voor elke kandidaat de openbare bron, bronpositie van -waarde, beoordelingsdatum van de koppeling en peildatum van de gegevens.
  4. 4Selecteer twee van drie kandidaten voor een vergelijking van openbare gegevens naast elkaar.
  5. 5Open de evaluatie met echte taken met de eerste twee kandidaten, bewerk de voorbeeldtaakset en test beide met vergelijkbare instellingen.

Zo leest u het resultaat

U krijgt drie officiële startkandidaten, zichtbaar openbaar bewijs waar beschikbaar en directe routes om te vergelijken van een test met echte taken uit te voeren.

Wat dit niet kan bewijzen

Een taakrangschikking is een eerste shortlist, geen universele ranglijst van bewijs van het beste model. Ontbrekend bewijs staat niet gelijk aan nul en wordt, in tegenstelling tot bij openbare bronnen, niet samengevoegd tot één score.

Veelgestelde vraag: Waarom kan een startkandidaat geen vergelijkbaar openbaar resultaat hebben?

Een officiële versie kan relevant zijn voor de taak op basis van productpositionering van implementatietype, zelfs als er in de geselecteerde openbare bron geen resultaat voor de exacte versie is gekoppeld. Het ontbrekende bewijs blijft zichtbaar en moet door middel van eigen tests worden aangevuld.

Terug naar boven
06

Radar voor modelupgrades

Stel de modellen die u gebruikt, terugkerend werk en prioriteiten in en beoordeel vervolgens voorzichtige signalen voor wanneer een eerlijke vergelijking de moeite waard is.

Openen

Waarvoor deze functie bedoeld is

Gebruik de radar om een praktische vraag te beantwoorden: is er voldoende vergelijkbaar openbaar bewijs om een alternatief te testen voor het model dat u nu gebruikt?

Voordat u begint

Kies exacte officiële versies, ten minste één terugkerende taak en maximaal twee prioriteiten. Gebruik dezelfde browser en hetzelfde apparaat, want de configuratie blijft lokaal.

Stapsgewijze zelfstudie

  1. 1Kies de exacte officiële versies die u momenteel gebruikt; opgeslagen modellen worden niet als actueel verondersteld.
  2. 2Selecteer terugkerende taken en maximaal twee prioriteiten, zoals kwaliteit, kosten, snelheid, privacy van lange context.
  3. 3Beoordeel van elk model het vergelijken waard is, veilig kan worden gevolgd van bijna wordt uitgefaseerd.
  4. 4Bekijk vergelijkbaar openbaar bewijs en test beide modellen vervolgens met hetzelfde echte werk.
  5. 5Beoordeel wekelijkse wijzigingen van abonneer u op de openbare RSS-feed met ranglijstwijzigingen.

Zo leest u het resultaat

De radar maakt een apparaatlokale upgradecontrole met een Actueel model, een taakgerelateerd alternatief indien beschikbaar, bewijsdatum, onzekerheidsgrens en directe vergelijkingsacties.

Wat dit niet kan bewijzen

Een upgradecontrole is geen directe instructie om over te stappen. Factoren zoals kosten, snelheid, privacy van context kunnen alsnog directe tests vereisen, en lokale instellingen worden niet gesynchroniseerd van geback-upt.

Veelgestelde vraag: Betekent ‘het vergelijken waard’ dat ik mijn huidige model moet vervangen?

Nee. Het betekent dat een vergelijkbaar signaal van een levenscycluswijziging een test met dezelfde taak de moeite waard maakt. Stap pas over nadat het alternatief bij uw echte werk en beperkingen slaagt.

Terug naar boven
07

Kies een AI-model

Zet vier praktische vereisten om in een uitlegbare shortlist.

Openen

Waarvoor deze functie bedoeld is

Gebruik de keuzehulp wanneer u weet welk werk u moet doen, maar niet welke modelserie u eerst moet onderzoeken.

Voordat u begint

Weet wat de belangrijkste taak is, waar het model mag draaien, wat uw belangrijkste operationele prioriteit is en van er een taalvereiste geldt.

Stapsgewijze zelfstudie

  1. 1Kies de taak die het dichtst bij uw echte werk ligt.
  2. 2Stel de implementatiegrens in, vooral wanneer gegevens uw omgeving niet mogen verlaten.
  3. 3Kies de prioriteit waarop u het minst bereid bent in te leveren.
  4. 4Stel de taalbehoefte in en bekijk vervolgens voor elke kandidaat de redenen voor de match, risico's en volgende validatiestap.
  5. 5Breng de sterkste kandidaten naar evaluatie met echte taken en test exacte modelversies met dezelfde taken.

Zo leest u het resultaat

Het kwalitatieve label en aantal overeenkomende vereisten gelden voor de modelserie, niet voor afzonderlijke versies; geen van beide is een benchmarkscore. Controleer de implementatiebeschikbaarheid van elke vermelde Actuele versie en vergelijk kandidaten met dezelfde taken.

Wat dit niet kan bewijzen

De keuzehulp roept geen modellen aan, verifieert geen Actuele prijzen en wijst geen universele winnaar aan. Een modelserie kan versies met verschillende mogelijkheden bevatten.

Veelgestelde vraag: Waarom stond een bekend model niet bovenaan?

De volgorde weerspiegelt uw geselecteerde beperkingen, niet de algemene populariteit. Wijzig één vereiste om te zien wat het resultaat veroorzaakte en test vervolgens exacte versies.

Terug naar boven
08

Modeldirectory en details

Bekijk door providers gedocumenteerde model-ID's, open speciale detailpagina's en controleer van vergelijkbare openbare ranglijstgegevens bestaan.

Openen

Waarvoor deze functie bedoeld is

Gebruik de directory wanneer u een exacte officiële model-ID, providerbestemming, geschikte en ongeschikte taken, bronnen en een duidelijke status van ranglijstgegevens nodig hebt.

Voordat u begint

Voer een modelnaam, provider, implementatiebehoefte van taak in. Een door de provider gedocumenteerde model-ID garandeert geen vergelijkbare openbare evaluatiegegevens.

Stapsgewijze zelfstudie

  1. 1Zoeken op model, versie, provider van taak.
  2. 2Filter op implementatiemethode en op gerangschikte van momenteel niet-gerangschikte status.
  3. 3Open een modeldetailpagina om identiteit, beoogd gebruik, dekking van openbare gegevens, sterke punten, beperkingen, bronnen en beoordelingsdatum te bekijken.
  4. 4Gebruik de officiële bestemming om Actuele beschikbaarheid, prijs, privacy en beperkingen te verifiëren.
  5. 5Voeg twee tot vier catalogusversies toe aan de gegevensvergelijking en selecteer vervolgens twee finalisten voor evaluatie aan de hand van praktijktaken.

Zo leest u het resultaat

Gerangschikt betekent dat vergelijkbare gepubliceerde gegevens aan die exacte model-ID zijn gekoppeld. Niet gerangschikt betekent dat deze editie geen geschikt vergelijkbaar record heeft; het is geen nulscore.

Wat dit niet kan bewijzen

Providerdocumentatie stelt de catalogusidentiteit vast, niet de actuele beschikbaarheid in elk land van serviceniveau. Ranglijstdekking, modeldetails en providervoorwaarden kunnen na de beoordelingsdatum veranderen.

Veelgestelde vraag: Betekent geen rangschikking dat het model zwak is?

Nee. Het betekent dat deze editie geen geschikte vergelijkbare openbare gegevens voor die model-ID heeft. Test het rechtstreeks als het relevant blijft voor uw beslissing.

Terug naar boven
09

Gegevensvergelijking

Vergelijk twee tot vier exacte officiële versies van records uit één gepubliceerde ranglijstweergave.

Openen

Waarvoor deze functie bedoeld is

Vergelijking van officiële versies organiseert door providers gedocumenteerde ID's uit gepubliceerde bronnen. Vergelijking van bronrecords behoudt de naam en instellingen van de uitgever wanneer een exacte officiële vergelijking informatie zou verliezen.

Voordat u begint

Kies voor officiële versies twee tot vier catalogus-ID's. Kies voor bronrecords twee tot vier rijen uit dezelfde bron, dimensie en momentopname.

Stapsgewijze zelfstudie

  1. 1Voeg een willekeurige rij uit een klassement toe. Bij configuratieveilige toewijzingen wordt de officiële versie vergeleken; bij alle andere rijen wordt het bronrecord vergeleken.
  2. 2Officiële resultaten blijven gescheiden per bron en dimensie.
  3. 3Resultaten van bronrecords behouden de gepubliceerde naam, instellingen, positie en score op één gemeenschappelijke bronschaal.
  4. 4Ontbrekende gegevens blijven onbekend in plaats van nul.
  5. 5Alleen exacte officiële versies kunnen na het kiezen van twee finalisten doorgaan naar evaluatie met echte taken.

Zo leest u het resultaat

De vergelijking maakt een bewijsbewuste shortlist en toont waar informatie ontbreekt. Ze levert geen nieuwe benchmarkscore op en wijst geen universele winnaar aan.

Wat dit niet kan bewijzen

OpenGPT roept de modellen in deze weergave niet aan. Gepubliceerde scores uit verschillende bronnen van bereiken zijn niet onderling uitwisselbaar en modeldetails kunnen na hun beoordelingsdatum veranderen.

Veelgestelde vraag: Hoe verschilt gegevensvergelijking van evaluatie met echte taken?

Gegevensvergelijking vat reeds gepubliceerde informatie voor twee tot vier modellen samen. Evaluatie met echte taken gebruikt precies twee versies, vraagt u dezelfde prompts in beide services uit te voeren en beoordeelt de geplakte antwoorden met verborgen modellabels.

Terug naar boven
10

Opgeslagen modellen

Bewaar in deze browser een kleine werklijst met items uit de ranglijst.

Openen

Waarvoor deze functie bedoeld is

Gebruik Opgeslagen modellen om snel naar kandidaten terug te keren, vertrouwde bestemmingen te openen en ondersteunde model-ID's naar een vergelijking te verplaatsen.

Voordat u begint

Gebruik dezelfde browser en hetzelfde apparaat. De lijst wordt lokaal opgeslagen, zonder OpenGPT-account van cloudsynchronisatie.

Stapsgewijze zelfstudie

  1. 1Selecteer Opslaan in een willekeurige ranglijstrij.
  2. 2Open Opgeslagen modellen via de bovenste navigatie om opgeslagen items te bekijken.
  3. 3Elk opgeslagen bronrecord toont de model-ID van modelnaam uit de bron. Records met een officiële model-ID kunnen ook de providerbestemming openen van aan een vergelijking deelnemen.
  4. 4Voeg twee verschillende ondersteunde model-ID's toe en open vervolgens de vergelijking van openbare gegevens. Kies daar twee finalisten voordat u een evaluatie met echte taken start.
  5. 5Verwijder items die u niet meer nodig hebt. Bij vernieuwen van veranderen van de sitetaal blijft de lijst in dezelfde browser.

Zo leest u het resultaat

Het aantal naast Opgeslagen modellen toont hoeveel items zijn opgeslagen. Bronidentiteit en officiële modelidentiteit blijven gescheiden.

Wat dit niet kan bewijzen

De lijst is geen account, synchronisatie van bladwijzers van back-up. Een andere browser van ander apparaat ziet deze niet en privénavigatie, opslagbeperkingen van het wissen van sitegegevens kan haar verwijderen.

Veelgestelde vraag: Waarom zijn mijn opgeslagen modellen verdwenen?

Controleer van u hetzelfde browserprofiel en apparaat gebruikt. Als siteopslag is gewist van geblokkeerd, kan OpenGPT de lokale lijst niet herstellen.

Terug naar boven
11

Proof Lab

Voer een privéproef uit met echt werk; in tijdelijke modus blijft ruwe uitvoer in het geheugen, tenzij u deze bewust op dit apparaat bewaart.

Openen

Waarvoor deze functie bedoeld is

Vergelijk 2–4 exacte Model- van Agent-configuraties met één gecontroleerd, controleerbaar takenpakket.

Voordat u begint

Leg elke exacte configuratie vast, open de relevante providerservices, verwijder gevoelige gegevens en onthoud dat providerbeleid geldt voor alles wat u daar indient.

Stapsgewijze zelfstudie

  1. 1Kies 2–4 exacte Model- van Agent-configuraties; behandel een familienaam niet als een reproduceerbare configuratie.
  2. 2Laad een sjabloon van maak een bewerkbaar takenpakket en bevries dit voordat u resultaten verzamelt.
  3. 3Voer elke bevroren taak zelf in elke configuratie uit en plak elke volledige uitvoer in de matrix.
  4. 4Gebruik een gebalanceerde, blinde beoordeling van alle paren. Leg Geslaagd, Mislukt, Geen uitsluitsel van Niet getest plus kritieke fouten vast; houd latentie en kosten als afzonderlijke waarnemingen bij en maak geen synthetische totaalscore.
  5. 5Beoordeel het onthulde bewijs en bevestig het beslissingsresultaat expliciet. Exporteer standaard metadata; neem alleen na toestemming volledige ruwe uitvoer op en verifieer de geëxporteerde bundel lokaal.

Zo leest u het resultaat

Het resultaat is een door de gebruiker bevestigde uitkomst die aan het bevroren takenpakket en de vastgelegde configuraties is gekoppeld. Export met alleen metadata is standaard; volledige ruwe export vereist expliciete toestemming en kan door de lokale verificateur worden gecontroleerd.

Wat dit niet kan bewijzen

Het verbergen van labels vermindert vertekening door zichtbare namen, maar is niet dubbelblind. OpenGPT voert de providers niet uit en bewijst niet de herkomst van uitvoer, nauwkeurigheid van configuraties, volledigheid, privacy bij externe providers van generaliseerbaarheid buiten deze taken. Resultaten van privéproeven zijn Getest op uw werk, geen Openbaar bewijs.

Veelgestelde vraag: Uploadt Proof Lab prompts van ruwe uitvoer?

De proef draait in uw browser. In tijdelijke modus blijft ruwe uitvoer in het geheugen; bewaren op dit apparaat is optioneel. Metadata-export sluit ruwe uitvoer uit en volledige ruwe export vereist expliciete toestemming.

Terug naar boven
12

Opgeslagen taaksets en herevaluatie

Gebruik dezelfde echte prompts opnieuw in een latere modelevaluatie zonder de taakset opnieuw op te bouwen.

Openen

Waarvoor deze functie bedoeld is

Gebruik opgeslagen taaksets om toekomstige vergelijkingen consistenter te maken en exacte modelversies na een release van wijziging in openbare gegevens opnieuw te evalueren.

Voordat u begint

Voltooi de taaktitels en prompts, kies een duidelijke naam voor de taakset en gebruik dezelfde browser en hetzelfde apparaat. Een taakset kan gevoelige werktekst bevatten; verwijder daarom privégegevens voordat u opslaat.

Stapsgewijze zelfstudie

  1. 1Bereid in Evaluatie met echte taken een taakset voor die uw werk vertegenwoordigt, van bewerk deze.
  2. 2Geef de taakset een herkenbare naam en sla deze op.
  3. 3Kies later de opgeslagen taakset en laad deze in de huidige evaluatie.
  4. 4Selecteer twee exacte modelversies en voer elke prompt met vergelijkbare instellingen uit.
  5. 5Kies vanuit een voltooid resultaat Opnieuw evalueren om de taken en modelversies te behouden en oude antwoorden, oordelen en het vorige rapport te wissen.

Zo leest u het resultaat

De naam, het sjabloon, de taal, taaktitels en prompts van de taakset worden lokaal opgeslagen voor hergebruik. Herevaluatie start een schone uitvoering met behoud van de beoogde testinvoer.

Wat dit niet kan bewijzen

Opgeslagen taaksets bestaan alleen op dit apparaat en worden niet gesynchroniseerd van geback-upt. Antwoorden, modelkeuzes, beoordelingen, rapporten en API-sleutels worden niet in een taakset opgeslagen. Het wissen van sitegegevens kan alle opgeslagen sets verwijderen.

Veelgestelde vraag: Wat verandert er wanneer ik Opnieuw evalueren kies?

OpenGPT behoudt dezelfde taken en exacte modelversies en wist vervolgens eerdere antwoorden, scores, oordelen, onthullingsstatus en het rapport, zodat de volgende uitvoering onafhankelijk is van het oude resultaat.

Terug naar boven
13

Deelbaar beslissingsrapport

Maak een privacymatige veilige link voor een shortlist van officiële modellen en de peildatum van de openbare gegevens.

Openen

Waarvoor deze functie bedoeld is

Gebruik het rapport om te delen welke taak en exacte officiële versies worden overwogen, welk openbaar bewijs beschikbaar is en welke kandidaat optioneel is geselecteerd.

Voordat u begint

Maak het rapport vanuit een taakranglijst. Bevestig vóór het delen de taak, exacte model-ID's, gegevenspeildatum en optionele keuze.

Stapsgewijze zelfstudie

  1. 1Open een taakranglijst en maak een rapport op basis van twee van drie officiële kandidaten.
  2. 2Markeer desgewenst één model als geselecteerd; het is geldig om de keuze leeg te laten.
  3. 3Dekking van openbare gegevens en rapportgrens beoordelen.
  4. 4Kopieer de link, gebruik het deelmenu van het apparaat, druk af van download het opgeschoonde JSON-record.
  5. 5Een ontvanger kan dezelfde shortlist openen, openbare gegevens vergelijken van een evaluatie op basis van praktijktaken starten.

Zo leest u het resultaat

De gedeelde URL bevat alleen de taak-ID, exacte officiële model-ID's, peildatum van openbare gegevens en optioneel het geselecteerde model, zodat de ontvanger dezelfde shortlist kan bekijken.

Wat dit niet kan bewijzen

Het deelbare rapport bevat geen prompts, modelantwoorden, notities, API-sleutels van volledig evaluatierapport. Het is een shortlistrecord, geen bewijs van een universele winnaar van geverifieerde provideruitvoer.

Veelgestelde vraag: Kan iemand via de deellink de inhoud van mijn evaluatie zien?

Nee. Prompts, antwoorden, notities, API-sleutels en het lokale evaluatieproject zijn uitgesloten. Controleer de koppeling altijd voordat u deze deelt als u informatie buiten de ondersteunde rapportstroom hebt toegevoegd.

Terug naar boven
14

Rapportverificatie

Controleer ondersteunde JSON-rapporten op structuur, interne consistentie, geheime patronen en een lokale vingerafdruk.

Openen

Waarvoor deze functie bedoeld is

Gebruik de verificateur om een OpenGPT Evidence v1- van v2-pakket te bekijken van een uit de Beslissingswerkruimte gedownload V3-rapport. Elke controle draait lokaal in deze browser.

Voordat u begint

Verkrijg het oorspronkelijke JSON-bestand. Download een vergelijkingsrapport vanuit de beslissingswerkruimte; voltooi eerst elk geval als u een voltooid resultaat in plaats van een concept nodig hebt.

Stapsgewijze zelfstudie

  1. 1Kies het JSON-bestand; het blijft in deze browser.
  2. 2Bevestig dat de verificateur Evidence v1/v2, OpenGPT private comparison v1/v2 van Beslissingswerkruimte v3 herkent.
  3. 3Controleer bij bewijspakketten de vereiste velden, uitvoeringen, tijdstempels, scores en controles op geheimen. Controleer bij vergelijkingsrapporten de namen van kandidaten, de taakset, de status Concept van Voltooid, unieke gevallen en van de samenvatting overeenkomt met de vastgelegde oordelen.
  4. 4Lees de opgegeven samenvatting en sla de SHA-256-vingerafdruk op als u later wilt bevestigen dat exact hetzelfde bestand wordt beoordeeld.
  5. 5Als een controle mislukt, corrigeer dan de brongegevens van voltooi de ontbrekende vergelijkingsgevallen in plaats van het gedownloade rapport te bewerken om een geslaagde controle af te dwingen.

Zo leest u het resultaat

Voor Evidence v1/v2 betekent Geslaagd dat het pakket de ondersteunde structuur- en consistentieregels volgt, terwijl Demo een voorbeeld aanduidt. Bij een vergelijkingsrapport betekent Geslaagd dat een voltooid rapport intern consistent is; Concept betekent dat de structuur geldig is maar de vergelijking niet af is. Mislukt betekent dat ten minste één vereiste controle moet worden beoordeeld.

Wat dit niet kan bewijzen

Een geslaagde test bewijst niet dat het genoemde model de weergegeven antwoorden heeft gegenereerd, dat de beweringen van de aanbieder kloppen, van dat het resultaat ook buiten de uitgevoerde tests geldig blijft. Resultaten uit niet-gerelateerde bestanden zijn niet automatisch vergelijkbaar.

Veelgestelde vraag: Bewijst een geslaagd vergelijkingsrapport dat één model beter is?

Nee. Het bevestigt alleen dat het ondersteunde rapport structureel geldig en intern consistent is. U moet de modelidentiteit, testkwaliteit, uitvoer en relevantie voor de beslissing nog steeds zelf beoordelen.

Terug naar boven
15

Evaluatiemethodologie

Leer wat een modelbeslissing controleerbaar en reproduceerbaar maakt.

Openen

Waarvoor deze functie bedoeld is

Gebruik deze pagina voordat u een evaluatie ontwerpt, publiceert van erop vertrouwt. Ze scheidt bewijskwaliteit van modelpopulariteit.

Voordat u begint

Begin met een concrete beslissingsvraag, genoemde modelversies, representatieve taken en een plan om ruwe uitvoer te bewaren.

Stapsgewijze zelfstudie

  1. 1Schrijf de beslissing en succescriteria op voordat u resultaten ziet.
  2. 2Gebruik voor elke kandidaat dezelfde taakset, instellingen en scoringsregels.
  3. 3Behoud prompts, uitvoer, instellingen, fouten, tijdstempels en vingerafdrukken van de testset.
  4. 4Vermeld wat handmatig, geautomatiseerd, met verborgen modellabels beoordeeld, gerandomiseerd van onafhankelijk gereproduceerd was.
  5. 5Publiceer conclusies samen met onzekerheid en expliciete beperkingen.

Zo leest u het resultaat

Evidence v1/v2 controleert vooral de indeling en verklaringen. Beslissingswerkruimte V3 ondersteunt lokale herberekening (L3); onafhankelijke reproductie op L4 wordt nog niet ondersteund.

Wat dit niet kan bewijzen

Een rigoureus proces kan vertekening (bias) verminderen, maar kan niet garanderen dat een steekproef representatief is voor elke gebruiker, taal, toekomstige versie van productieomstandigheid.

Veelgestelde vraag: Is een hoger bewijsniveau altijd nodig?

Stem de grondigheid af op de gevolgen. Voor een persoonlijke proef kan L1 volstaan; zoek bij een openbare claim van een claim met grote gevolgen naar sterker onafhankelijk bewijs.

Terug naar boven

Woordenlijst in gewone taal

Gebruik deze definities wanneer een label onbekend is.

Bronrecord
Een rij die behouden is gebleven vanuit een gepubliceerde ranglijst, waarbij het bronmodel ID van de naam exact is overgenomen voor beoordeling en controle.
Officiële model-ID
Een door de aanbieder gedocumenteerde model-id die (OpenGPT) gescheiden houdt van de naam van het bronrecord.
Catalogusversie
Een modelversie zoals vermeld in de documentatie van de aanbieder, inclusief de officiële bestemming en beoordelingsbron.
Waarschijnlijk scorebereik
Een gepubliceerd onzekerheidsinterval rond de weergegeven score. Bredere bereiken duiden op minder nauwkeurigheid; bereiken van verschillende ranglijstbronnen zijn niet direct vergelijkbaar.
Mijn modellen
Een shortlist die alleen in deze browser wordt opgeslagen. Het betreft geen account, cloudsynchronisatie van bladwijzer bij een aanbieder.
Geschiktheid voor vereisten
Een kwalitatief label voor 'familie-geschiktheid' (family-fit) plus het aantal overeenkomende vereisten; geen van beide beoordeelt individuele versies. Controleer de beschikbaarheid en vergelijk exacte versies aan de hand van dezelfde taken.
Modelfamilie
Een groep gerelateerde modelversies. Mogelijkheden, prijzen en toegang kunnen per versie verschillen.
Benchmark
Een herhaalbare taakset en scoringsregel die worden gebruikt om systemen onder vastgestelde voorwaarden te vergelijken.
Agentconfiguratie
Het basismodel, de scaffold, hulpmiddelen, rechten, budget, omgeving, benchmarkversie en datum die één Agent-resultaat hebben opgeleverd.
Bewijskwaliteit
Een label dat beschrijft hoe een resultaat tot stand is gekomen van is gecontroleerd. Het wijzigt de oorspronkelijke score niet.
Kosten per succes
Gerapporteerde evaluatiekosten gedeeld door geslaagde taken. Dit wordt alleen getoond wanneer er vergelijkbare brongegevens bestaan; ontbrekende kosten zijn niet nul.
Bewijsbestand
Een gestructureerd record dat vastlegt hoe een evaluatie is uitgevoerd en wat de bevindingen waren.
Schema
De machineleesbare regels die vereiste velden en toegestane waarden in een bestand definiëren.
SHA-256-vingerafdruk
Een lokale identificatiecode voor de exacte bytes van een bestand; wijziging van het bestand verandert de vingerafdruk.

Probleemoplossing

Geen model voldoet aan elke vereiste

Bekijk door welke vereiste elke kandidaat is uitgesloten en versoepel alleen een beperking die werkelijk flexibel is.

Vereisten beoordelen

Een rangnummer uit de bron wordt overgeslagen

De uitgever kan gelijke posities van meerdere configuraties gebruiken. OpenGPT behoudt de oorspronkelijke positie in plaats van de zichtbare rijen opnieuw te nummeren.

De ranglijst beoordelen

Bij een agentresultaat ontbreken kosten- van betrouwbaarheidsgegevens.

De bron heeft geen vergelijkbare waarde gepubliceerd. OpenGPT laat deze niet-gerapporteerd in plaats van haar als nul te behandelen; vergelijk alleen waarden uit hetzelfde benchmarkbereik.

Agent-bewijs beoordelen

Een rij zonder officieel model ID

Dit is een volledig bronrecord en geen onopgeloste status. Open de oorspronkelijke bron; gebruik de modeldirectory wanneer u een door de provider gedocumenteerde identiteit en officiële toegang nodig hebt.

Bronidentiteit beoordelen

Mijn modellen is leeg van verdwenen

Gebruik hetzelfde browserprofiel en apparaat. Privémodus, geblokkeerde opslag van het wissen van sitegegevens kan de lokale lijst verwijderen.

Mijn modellen openen

Een record kan niet aan de gegevensvergelijking worden toegevoegd.

Gegevensvergelijking accepteert catalogusmodel-ID's. Hetzelfde model is mogelijk al geselecteerd van de limiet van vier modellen is bereikt. Kies een andere catalogusversie van verwijder eerst een kandidaat.

Modeldirectory openen

De Proof Lab-proef is onvolledig

Ga terug naar de proef en voltooi elke vereiste uitvoer voor configuratie en taak, beoordelingsstatus, controle op kritieke fouten en door de gebruiker bevestigd resultaat.

Doorgaan met Proof Lab

Een lokaal concept vertoont een conflict van moet worden gereset.

Ga terug naar Vergelijken, bekijk de waarschuwing voor het nieuwere lokale concept en behoud van herstel het concept vervolgens bewust.

Lokaal concept beoordelen

Een bewijsbestand voldoet niet.

Gebruik het mislukte checklistitem om het bronrecord te corrigeren. Voeg geen geheimen toe en herschrijf geen resultaten.

Verificateur openen
contact@opengpt.com

Nog hulp nodig?

Meld een defecte koppeling, onjuist modeldetail van probleem dat u niet kon oplossen.

Ondersteuning per e-mail