ANLEITUNGEN UND SUPPORT

OpenGPT-Hilfe-Center

Finden Sie den passenden Ablauf, folgen Sie jedem Schritt und verstehen Sie, was das Ergebnis aussagen kann – und was nicht.

Mit Ihrem Vorhaben beginnen

Jeder Arbeitsablauf beantwortet eine andere Frage. Beginnen Sie mit dem passendsten Ziel und folgen Sie anschließend dem verknüpften Leitfaden.

1ModellrankingsVeröffentlichte Signale und Identitätsstatus verstehen.2Agenten-RanglistenWählen Sie vollständige Agentenkonfigurationen anhand von Aufgabe und Belegen aus.3AuswählenKandidaten anhand realer Anforderungen eingrenzen.4Öffentliche Daten vergleichenStellen Sie zwei bis vier Katalog-Modell-IDs nebeneinander.5Modelle speichernFühren Sie in diesem Browser eine lokale Auswahlliste.6Einen Test in Proof Lab durchführenTesten Sie 2–4 exakte Modell- oder Agent-Konfigurationen mit einem fixierten Aufgabenpaket.7Evidenz einreichen oder korrigierenEine öffentliche Modell- oder Agent-Quelle zur redaktionellen Prüfung senden.8Einen Bericht prüfenPrüfen Sie einen OpenGPT-JSON-Bericht lokal, bevor Sie ihn teilen.

01

AI Modell-Rankings

Sehen Sie, was in die Rangliste eingeht, woher die Daten stammen und welche Datensätze eine offizielle Modell-ID enthalten.

Offen

Wofür diese Funktion gedacht ist

Jede Ranglistenperspektive nutzen, um veröffentlichte Signale zu untersuchen, Quelldatensätze zu prüfen und eine Auswahlliste für Tests mit realen Aufgaben zu erstellen.

Bevor Sie beginnen

Beginnen Sie mit der Frage, die Sie beantworten müssen. Nutzerpräferenz, Gesamtleistung, objektive Aufgaben, Kosten und Open-Weight-Ranglisten verwenden unterschiedliche Quellen und Skalen.

Schritt-für-Schritt-Anleitung

  1. 1Wählen Sie die Ranking-Perspektive, die zu Ihrer Entscheidung passt.
  2. 2„Vollständige Quellrangliste“ für jeden Datensatz des Herausgebers oder „Offizielle Modell-IDs“ für durch Anbieterdokumentation verknüpfte Datensätze verwenden.
  3. 3Betrachten Sie Quellposition, Punktespanne, Stimmen, Lizenz und Konfiguration gemeinsam.
  4. 4Öffnen Sie in einer beliebigen Zeile die Modelldetails. Exakte offizielle Zuordnungen verwenden das offizielle Profil; alle anderen Zeilen öffnen ein Quellprofil, das den veröffentlichten Namen und die Konfiguration bewahrt.
  5. 5Beliebige Zeile zum Vergleich hinzufügen. Exakte, konfigurationssichere Zuordnungen nutzen den Vergleich der offiziellen Version; alle anderen Zeilen nutzen den Vergleich der Quelldatensätze innerhalb derselben Quelle, Dimension und desselben Snapshots.

So lesen Sie das Ergebnis

Ein Rang bezieht sich auf eine bestimmte Quelle und einen bestimmten Anwendungsbereich. Bei Gleichständen können Rangnummern übersprungen werden; Werte aus unterschiedlichen Bewertungskategorien sind nicht direkt vergleichbar.

Was es nicht nachweisen kann

OpenGPT ordnet öffentliche Daten Dritter und hat diese Evaluierungen nicht erneut ausgeführt. Kein Ranking ermittelt für jeden Nutzer oder jede Aufgabe das beste Modell.

Häufige Frage: Warum zeigen manche Zeilen nur eine Quellmodell-ID oder einen Namen an?

Jede Zeile enthält nun Modelldetails und eine Vergleichsaktion. OpenGPT ergänzt nur dann eine offizielle Modell-ID, wenn die Anbieterdokumentation die exakte Zuordnung belegt; andernfalls bleiben beim Vergleich von Quelldatensätzen Herausgebername, Konfiguration und Ranglistendaten erhalten, ohne eine neue offizielle ID zu erfinden.

Nach oben
02

AI-Agenten-Rankings

Wählen Sie einen Agenten anhand von Aufgabe, vollständiger Konfiguration, Belegqualität und vergleichbaren Ergebnissen.

Offen

Wofür diese Funktion gedacht ist

Erkunden Sie 96 veröffentlichte Agenten-Bewertungskonfigurationen aus sieben Aufgabenbereichen sowie 109 separate BFCL-Ergebnisse für Tool-Aufrufe, ohne inkompatible Nachweise zu einer einzigen Bewertung zusammenzufassen.

Bevor Sie beginnen

Ein Agenten-Ergebnis gehört zu einer vollständigen Konfiguration: Basismodell, Gerüst (Scaffold), Tools, Berechtigungen, Budget, Umgebung, Benchmark-Version und Datum. OpenGPT behält die von der Quelle gemeldeten Felder bei und lässt fehlende Felder unberücksichtigt – sie werden nicht als Nullwert geführt.

Schritt-für-Schritt-Anleitung

  1. 1Wählen Sie die Aufgabenkategorie, die zu Ihrer Arbeit passt.
  2. 2Prüfen Sie Benchmark-Umfang, Version, Evaluationsdatum, Aktualität und Prüfvermerk, bevor Sie den Rang interpretieren.
  3. 3Die Evidenzstufe verwenden, um reproduzierte oder geprüfte Ergebnisse von transparenten öffentlichen Durchläufen und vom Anbieter gemeldeten Ergebnissen zu unterscheiden.
  4. 4Vergleichen Sie Erfolg, Belege aus wiederholten Durchläufen, Dauer und erforderliche Eingriffe nur dann, wenn die Quelle sie unter denselben Bedingungen angibt. OpenGPT zeigt die Kosten pro Erfolg nur, wenn die veröffentlichte Gesamtsumme und der Aufgaben- bzw. Durchlaufnenner denselben verifizierten Umfang verwenden.
  5. 5Folgen Sie nützlichen Konfigurationen, prüfen Sie deren Verlauf und wählen Sie zwei bis vier Einträge aus derselben vergleichbaren Gruppe für eine Gegenüberstellung aus.

So lesen Sie das Ergebnis

Ein Rang bezieht sich auf eine vollständige Systemkonfiguration innerhalb eines bestimmten Benchmark-Bereichs. Berücksichtigen Sie dabei auch den Grad der Nachweisbarkeit, die Aktualität, die Anzahl der Stichproben oder Testläufe sowie Angaben zu Kosten und Zuverlässigkeit.

Was es nicht nachweisen kann

OpenGPT erstellt keine universelle Agent-Punktzahl. Sofern ein Ergebnis nicht ausdrücklich als reproduziert gekennzeichnet ist, ordnet OpenGPT Belege aus vorgelagerten Quellen, statt die Evaluierung erneut auszuführen; kein Benchmark belegt die Produktionsreife für jeden Workflow.

Häufige Frage: Warum kann derselbe Agent oder dasselbe Modell mehrmals erscheinen?

Ein anderes Grundgerüst (Scaffold), eine andere Modellversion, ein anderes Toolset, eine andere Berechtigungsstufe, ein anderes Budget oder eine andere Benchmark-Einstellung führen zu einer abweichenden Agentenkonfiguration und müssen als separater Datensatz geführt werden.

Nach oben
03

Modell oder Agent einreichen

Einen öffentlichen Identitäts- oder Evidenzdatensatz zur Prüfung senden, ohne die Ranglisten zu ändern.

Offen

Wofür diese Funktion gedacht ist

Den Einreichungsablauf verwenden, wenn eine offizielle Modell-ID oder ein Agent-Produkt fehlt oder wenn eine öffentliche Quelle redaktionell geprüft werden muss.

Bevor Sie beginnen

Melden Sie sich mit einem verifizierten Konto an und halten Sie eine öffentliche HTTPS-Quelle bereit. Reichen Sie niemals Zugangsdaten, private Dateien oder personenbezogene Daten ein.

Schritt-für-Schritt-Anleitung

  1. 1Wählen Sie oben im Formular Modell oder Agentenprodukt aus.
  2. 2Geben Sie den exakten öffentlichen Namen, den Anbieter oder die Organisation sowie die angeforderten Identitätsangaben ein.
  3. 3Wählen Sie den Quellentyp und verlinken Sie auf offizielle Dokumentation, ein öffentliches Repository oder ein öffentliches Benchmark-Ergebnis.
  4. 4Erläutern Sie, was der Prüfer kontrollieren soll, und reichen Sie dann einmal ein.
  5. 5Verfolgen Sie den Prüfstatus unter Ihren jüngsten Einreichungen. Ein genehmigtes Agent-Produkt wird automatisch im durchsuchbaren Agentenverzeichnis aufgeführt; die Rangliste bleibt davon getrennt.

So lesen Sie das Ergebnis

Eine erfolgreiche Einreichung erhält eine Referenznummer und gelangt in die Prüfwarteschlange. Ein genehmigtes Agenten-Produkt ist ein öffentlicher Verzeichniseintrag, kein Rang in einer Bestenliste und keine Zertifizierung gemäß OpenGPT.

Was es nicht nachweisen kann

Einreichende können Rang, Evidenzstufe, Vergleichbarkeit oder Veröffentlichungsstatus nicht festlegen. Duplikat- und Ratenlimits verringern Missbrauch und eine Genehmigung ändert eine Rangfolge nie automatisch.

Häufige Frage: Warum wurde eine genehmigte Einreichung nicht in die Rangliste aufgenommen?

Zugelassene Agentenprodukte sind im Verzeichnis auffindbar; für ein Ranking sind jedoch weiterhin vergleichbare öffentliche Evaluationsbelege erforderlich.

Nach oben
04

Ranglistenänderungen und Versionsverlauf

Bewegungen zwischen vergleichbaren Snapshots verfolgen und Modell-IDs im Katalog vergleichen.

Offen

Wofür diese Funktion gedacht ist

Auf dieser Seite sehen, was sich seit dem vorherigen Quellsnapshot verändert hat, welche Datensätze erstmals erschienen sind, wie sich exakte Versionen unterscheiden und wann Daten abgerufen wurden.

Bevor Sie beginnen

Die historische Entwicklung verwendet derzeit den Bereich der LMArena-Nutzerpräferenzen. Andere aktive Quellen zeigen nur den aktuellen Stand, bis ein vergleichbarer früherer Snapshot vorliegt.

Schritt-für-Schritt-Anleitung

  1. 1Prüfen Sie Quelldatum, Vergleichsbasis, Abrufdatum und Vergleichsregel.
  2. 2Betrachten Sie die schnellsten Aufsteiger nur unter den Datensätzen, die in beiden Snapshots enthalten sind.
  3. 3„Erstmals erschienen“ als neuen Quelleneintrag behandeln, nicht als offizielles Veröffentlichungsdatum.
  4. 4Die Bewegungstabelle nach aufgestiegen, abgestiegen, unverändert, erstmals erschienen oder nicht mehr gelistet filtern.
  5. 5Vergleichen Sie zwei Modell-IDs aus dem Katalog und laden Sie bei Bedarf einen Quell-Snapshot für den Prüfpfad herunter.

So lesen Sie das Ergebnis

OpenGPT berechnet Veränderungen nur, wenn Quelle, Umfang, Einheit und Methode übereinstimmen, und bewahrt herunterladbare monatliche Snapshots auf.

Was es nicht nachweisen kann

Nur vom Anbieter dokumentierte Veröffentlichungsdaten gelten als Produktveröffentlichungen. Der Versionsvergleich leitet aus Namen weder Geschwindigkeit noch Preis, Kontextlänge oder Qualität ab.

Häufige Frage: Warum zeigt LiveBench keine Rangbewegung an?

OpenGPT hat für diese aktive Quelle noch keine vergleichbare frühere Ausgabe festgeschrieben. Pausierte Quellen bleiben historisch und tragen nicht zu aktuellen Veränderungen bei.

Nach oben
05

Rankings nach Aufgabe

Mit einem realen Arbeitsszenario beginnen und drei offizielle Modellversionen prüfen, die zuerst getestet werden sollten.

Offen

Wofür diese Funktion gedacht ist

Aufgabenranglisten verwenden, um breite öffentliche Signale in eine kleine, praktische Auswahlliste für Programmierung, Recherche, Dokumente, Support, mehrsprachige oder multimodale Arbeit, Kosten, Datenschutz oder Geschwindigkeit zu überführen.

Bevor Sie beginnen

Wählen Sie die Aufgabe, die Ihrer Arbeit am nächsten kommt, und notieren Sie anschließend Ihre tatsächlichen Prompts, Daten, Tools, Region, Ihr Budget und Ihre Datenschutzanforderungen. Die angezeigten öffentlichen Belege können einen breiteren Umfang als Ihre Aufgabe abdecken.

Schritt-für-Schritt-Anleitung

  1. 1Öffnen Sie das Aufgabenszenario, das Ihrer anstehenden Entscheidung am nächsten kommt.
  2. 2Lesen Sie, warum die drei offiziellen Versionen ausgewählt wurden und welche Unsicherheiten bestehen bleiben.
  3. 3Prüfen Sie für jeden Kandidaten die öffentliche Quelle, den Quellenrang oder -wert, das Prüfdatum der Zuordnung und den Datenstichtag.
  4. 4Wählen Sie zwei oder drei Kandidaten für einen direkten Vergleich öffentlicher Daten aus.
  5. 5Öffnen Sie die Evaluierung realer Aufgaben mit den ersten beiden Kandidaten, bearbeiten Sie den Beispielaufgabensatz und testen Sie beide mit vergleichbaren Einstellungen.

So lesen Sie das Ergebnis

Sie erhalten drei offizielle Ausgangskandidaten, soweit verfügbar sichtbare öffentliche Evidenz und direkte Wege, einen Vergleich oder einen Test mit realen Aufgaben durchzuführen.

Was es nicht nachweisen kann

Ein aufgabenbezogenes Ranking ist eine erste Auswahlliste, kein universelles Ranking oder Nachweis für das beste Modell. Fehlende Nachweise werden nicht als Nullwert gewertet und – im Gegensatz zu öffentlichen Quellen – nicht zu einem Gesamtpunktwert zusammengefasst.

Häufige Frage: Warum kann es für einen Ausgangskandidaten kein vergleichbares öffentliches Ergebnis geben?

Eine offizielle Version kann für die Aufgabe relevant sein (aufgrund der Produktpositionierung oder Bereitstellungsart), auch wenn in der gewählten öffentlichen Quelle kein Ergebnis für die exakte Version hinterlegt ist. Der fehlende Nachweis bleibt sichtbar und muss durch eigene Tests geklärt werden.

Nach oben
06

Radar für Modell-Upgrades

Legen Sie die von Ihnen verwendeten Modelle, wiederkehrenden Arbeiten und Prioritäten fest und prüfen Sie anschließend vorsichtige Signale dafür, wann ein fairer Vergleich sinnvoll ist.

Offen

Wofür diese Funktion gedacht ist

Mit dem Radar eine praktische Frage beantworten: Gibt es genügend vergleichbare öffentliche Evidenz, um eine Alternative zum derzeit verwendeten Modell zu testen?

Bevor Sie beginnen

Wählen Sie exakte offizielle Versionen, mindestens eine wiederkehrende Aufgabe und bis zu zwei Prioritäten. Verwenden Sie denselben Browser und dasselbe Gerät, da die Einrichtung lokal gespeichert bleibt.

Schritt-für-Schritt-Anleitung

  1. 1Wählen Sie die exakten offiziellen Versionen aus, die Sie derzeit verwenden; gespeicherte Modelle gelten nicht automatisch als aktuell.
  2. 2Wählen Sie wiederkehrende Aufgaben und bis zu zwei Prioritäten wie Qualität, Kosten, Geschwindigkeit, Datenschutz oder langen Kontext aus.
  3. 3Prüfen, ob sich ein Vergleich für jedes Modell lohnt, ob es unbedenklich weiter beobachtet werden kann oder sich dem Ende seines Lebenszyklus nähert.
  4. 4Prüfen Sie vergleichbare öffentliche Nachweise und testen Sie anschließend beide Modelle anhand derselben realen Arbeit.
  5. 5Wöchentliche Änderungen prüfen oder den öffentlichen RSS-Feed zu Ranglistenänderungen abonnieren.

So lesen Sie das Ergebnis

Das Radar erstellt eine gerätelokale Upgrade-Prüfung mit einem aktuellen Modell, einer auf die Aufgabe abgestimmten Alternative, sofern verfügbar, dem Evidenzdatum, der Unsicherheitsgrenze und direkten Vergleichsaktionen.

Was es nicht nachweisen kann

Eine Upgrade-Prüfung ist keine Aufforderung zum Wechsel. Faktoren wie Kosten, Geschwindigkeit, Datenschutz oder Kontext können weiterhin direkte Tests erforderlich machen; zudem werden lokale Einstellungen nicht synchronisiert oder gesichert.

Häufige Frage: Bedeutet „einen Vergleich wert“, dass ich mein aktuelles Modell ersetzen sollte?

Nein. Es bedeutet, dass ein vergleichbares Signal oder eine Änderung im Lebenszyklus einen Test mit derselben Aufgabe sinnvoll macht. Wechseln Sie erst, wenn die Alternative bei Ihrer realen Arbeit und unter Ihren Bedingungen erfolgreich ist.

Nach oben
07

KI-Modell auswählen

Vier praktische Anforderungen in eine nachvollziehbare Auswahlliste überführen.

Offen

Wofür diese Funktion gedacht ist

Den Finder verwenden, wenn Sie wissen, welche Arbeit zu erledigen ist, aber nicht, welche Modellreihe Sie zuerst untersuchen sollten.

Bevor Sie beginnen

Klären Sie die Hauptaufgabe, wo das Modell ausgeführt werden darf, Ihre wichtigste betriebliche Priorität und etwaige Sprachanforderungen.

Schritt-für-Schritt-Anleitung

  1. 1Wählen Sie die Aufgabe, die Ihrer realen Arbeit am nächsten kommt.
  2. 2Die Bereitstellungsgrenze festlegen, insbesondere wenn Daten Ihre Umgebung nicht verlassen dürfen.
  3. 3Wählen Sie die Priorität, bei der Sie am wenigsten zu Kompromissen bereit sind.
  4. 4Den Sprachbedarf festlegen und anschließend für jeden Kandidaten die Gründe für die Übereinstimmung, Risiken und den nächsten Validierungsschritt prüfen.
  5. 5Überführen Sie die stärksten Kandidaten in eine Bewertung mit realen Aufgaben und testen Sie exakte Modellversionen anhand derselben Aufgaben.

So lesen Sie das Ergebnis

Die qualitative Bezeichnung und die Anzahl übereinstimmender Anforderungen gelten für die Modellreihe und nicht für einzelne Versionen; keines von beidem ist ein Benchmark-Wert. Prüfen Sie die Bereitstellungsverfügbarkeit jeder aufgeführten aktuellen Version und vergleichen Sie Kandidaten anhand derselben Aufgaben.

Was es nicht nachweisen kann

Der Finder ruft keine Modelle auf, überprüft keine aktuellen Preise und benennt keinen allgemeingültigen Sieger. Eine Modellreihe kann Versionen mit unterschiedlichen Fähigkeiten umfassen.

Häufige Frage: Warum ist ein bekanntes Modell nicht an erster Stelle erschienen?

Die Reihenfolge spiegelt Ihre ausgewählten Rahmenbedingungen wider und nicht die allgemeine Beliebtheit. Ändern Sie eine Anforderung, um die Ursache des Ergebnisses zu erkennen, und testen Sie anschließend exakte Versionen.

Nach oben
08

Modellverzeichnis und -details

Durchsuchen Sie vom Anbieter dokumentierte Modell-IDs, öffnen Sie eigene Detailseiten und prüfen Sie, ob vergleichbare öffentliche Ranking-Daten vorliegen.

Offen

Wofür diese Funktion gedacht ist

Das Verzeichnis verwenden, wenn Sie eine exakte offizielle Modell-ID, ein Anbieterziel, geeignete und ungeeignete Aufgaben, Quellen und einen eindeutigen Status der Ranglistendaten benötigen.

Bevor Sie beginnen

Geben Sie einen Modellnamen, Anbieter, Bereitstellungsbedarf oder eine Aufgabe ein. Eine vom Anbieter dokumentierte Modell-ID garantiert keine vergleichbaren öffentlichen Evaluationsdaten.

Schritt-für-Schritt-Anleitung

  1. 1Nach Modell, Version, Anbieter oder Aufgabe suchen.
  2. 2Nach Bereitstellungsmethode und Ranglistenstatus – bewertet oder derzeit unbewertet – filtern.
  3. 3Öffnen Sie eine Modelldetailseite, um Identität, vorgesehenen Einsatz, Abdeckung durch öffentliche Daten, Stärken, Einschränkungen, Quellen und Prüfdatum zu prüfen.
  4. 4Am offiziellen Ziel aktuelle Verfügbarkeit, Preise, Datenschutz und Grenzen verifizieren.
  5. 5Fügen Sie zwei bis vier Katalogversionen zum Datenvergleich hinzu und wählen Sie anschließend zwei Finalisten für die Evaluierung anhand realer Aufgaben aus.

So lesen Sie das Ergebnis

„Mit Ranking“ bedeutet, dass mit dieser exakten Modell-ID vergleichbare veröffentlichte Daten verknüpft sind. „Ohne Ranking“ bedeutet, dass diese Ausgabe keinen geeigneten vergleichbaren Datensatz enthält; es handelt sich nicht um eine Punktzahl von null.

Was es nicht nachweisen kann

Die Anbieterdokumentation belegt die Katalogidentität, nicht die aktuelle Verfügbarkeit in jedem Land oder jeder Service-Stufe. Rankingabdeckung, Modelldetails und Anbieterbedingungen können sich nach dem Prüfdatum ändern.

Häufige Frage: Bedeutet „ohne Ranking“, dass das Modell schwach ist?

Nein. Es bedeutet, dass diese Ausgabe für diese Modell-ID keine geeigneten vergleichbaren öffentlichen Daten enthält. Testen Sie das Modell direkt, wenn es für Ihre Entscheidung weiterhin relevant ist.

Nach oben
09

Datenvergleich

Vergleichen Sie zwei bis vier exakte offizielle Versionen oder Einträge aus einer veröffentlichten Rankingansicht.

Offen

Wofür diese Funktion gedacht ist

Der Vergleich offizieller Versionen ordnet anbieterdokumentierte IDs über veröffentlichte Quellen hinweg. Der Vergleich von Quelldatensätzen bewahrt Namen und Einstellungen des Herausgebers, wenn bei einem exakten offiziellen Vergleich Informationen verloren gingen.

Bevor Sie beginnen

Wählen Sie für offizielle Versionen zwei bis vier Katalog-IDs. Wählen Sie für Quelldatensätze zwei bis vier Zeilen aus derselben Quelle, Dimension und demselben Snapshot.

Schritt-für-Schritt-Anleitung

  1. 1Beliebige Zeile aus einer Rangliste hinzufügen. Konfigurationssichere Zuordnungen nutzen den Vergleich der offiziellen Version; alle anderen Zeilen nutzen den Vergleich der Quelldatensätze.
  2. 2Offizielle Ergebnisse bleiben nach Quelle und Dimension getrennt.
  3. 3Ergebnisse aus Quelldatensätzen bewahren den veröffentlichten Namen, die Einstellungen, den Rang und die Bewertung auf einer gemeinsamen Quellskala.
  4. 4Fehlende Daten bleiben unbekannt und werden nicht als null behandelt.
  5. 5Nur exakte offizielle Versionen können nach Auswahl zweier Finalisten mit der Evaluierung realer Aufgaben fortfahren.

So lesen Sie das Ergebnis

Der Vergleich erstellt eine evidenzbewusste Auswahlliste und zeigt, wo Informationen fehlen. Er erzeugt weder einen neuen Benchmark-Wert noch erklärt er einen allgemeingültigen Sieger.

Was es nicht nachweisen kann

OpenGPT ruft die Modelle in dieser Ansicht nicht auf. Veröffentlichte Punktzahlen aus verschiedenen Quellen oder Umfängen sind nicht austauschbar, und Modelldetails können sich nach ihrem Prüfdatum ändern.

Häufige Frage: Wie unterscheidet sich ein Datenvergleich von einer Bewertung anhand realer Aufgaben?

Der Datenvergleich fasst bereits veröffentlichte Informationen zu zwei bis vier Modellen zusammen. Die Evaluierung anhand realer Aufgaben verwendet genau zwei Versionen, fordert Sie auf, dieselben Prompts in beiden Diensten auszuführen, und prüft die eingefügten Antworten bei ausgeblendeten Modellbezeichnungen.

Nach oben
10

Gespeicherte Modelle

Führen Sie in diesem Browser eine kleine Arbeitsliste mit Ranglisteneinträgen.

Offen

Wofür diese Funktion gedacht ist

Gespeicherte Modelle verwenden, um schnell zu Kandidaten zurückzukehren, vertrauenswürdige Ziele zu öffnen und unterstützte Modell-IDs in einen Vergleich zu übernehmen.

Bevor Sie beginnen

Denselben Browser und dasselbe Gerät verwenden. Die Liste wird lokal gespeichert, ohne OpenGPT-Konto oder Cloud-Synchronisierung.

Schritt-für-Schritt-Anleitung

  1. 1Wählen Sie in einer beliebigen Ranglistenzeile „Speichern“ aus.
  2. 2Öffnen Sie in der oberen Navigation „Gespeicherte Modelle“, um gespeicherte Einträge zu prüfen.
  3. 3Jeder gespeicherte Quelldatensatz zeigt seine Quellmodell-ID oder seinen Quellnamen. Datensätze mit einer offiziellen Modell-ID können außerdem das Anbieterziel öffnen oder in einen Vergleich aufgenommen werden.
  4. 4Fügen Sie zwei verschiedene unterstützte Modell-IDs hinzu und öffnen Sie dann den Vergleich öffentlicher Daten. Wählen Sie dort zwei Finalisten aus, bevor Sie eine Evaluierung anhand realer Aufgaben starten.
  5. 5Entfernen Sie nicht mehr benötigte Einträge. Beim Aktualisieren oder Ändern der Website-Sprache bleibt die Liste im selben Browser erhalten.

So lesen Sie das Ergebnis

Die Zahl neben Gespeicherte Modelle zeigt, wie viele Einträge gespeichert sind. Quellenidentität und offizielle Modellidentität bleiben getrennt.

Was es nicht nachweisen kann

Die Liste ist weder ein Konto noch eine Lesezeichensynchronisierung oder Sicherung. In einem anderen Browser oder auf einem anderen Gerät ist sie nicht sichtbar und durch privates Surfen, Speicherbeschränkungen oder das Löschen von Websitedaten kann sie entfernt werden.

Häufige Frage: Warum sind meine gespeicherten Modelle verschwunden?

Prüfen Sie, ob Sie dasselbe Browser-Profil und Gerät verwenden. Wurde der Website-Speicher gelöscht oder blockiert, kann OpenGPT die lokale Liste nicht wiederherstellen.

Nach oben
11

Proof Lab

Einen privaten Test mit realer Arbeit durchführen; im temporären Modus bleiben Rohausgaben im Arbeitsspeicher, sofern Sie sie nicht bewusst auf diesem Gerät aufbewahren.

Offen

Wofür diese Funktion gedacht ist

2–4 exakte Modell- oder Agentenkonfigurationen mit einem kontrollierten, nachvollziehbaren Aufgabenpaket vergleichen.

Bevor Sie beginnen

Erfassen Sie jede exakte Konfiguration, öffnen Sie die relevanten Anbieterdienste, entfernen Sie sensible Daten und beachten Sie, dass für alle dort übermittelten Inhalte die Anbieterrichtlinien gelten.

Schritt-für-Schritt-Anleitung

  1. 1Wählen Sie 2–4 exakte Modell- oder Agentenkonfigurationen; behandeln Sie einen Familiennamen nicht als reproduzierbare Konfiguration.
  2. 2Laden Sie eine Vorlage oder erstellen Sie ein bearbeitbares Aufgabenpaket und fixieren Sie es, bevor Sie Ergebnisse erfassen.
  3. 3Führen Sie jede fixierte Aufgabe selbst in jeder Konfiguration aus und fügen Sie jede vollständige Ausgabe in die Matrix ein.
  4. 4Verwenden Sie eine ausgewogene, anonymisierte Paarprüfung aller Kandidaten. Erfassen Sie Pass, Fail, Inconclusive oder Not tested sowie kritische Fehler; behandeln Sie Latenz und Kosten als getrennte Beobachtungen und erstellen Sie keine synthetische Gesamtbewertung.
  5. 5Prüfen Sie die offengelegte Evidenz und bestätigen Sie das Entscheidungsergebnis ausdrücklich. Exportieren Sie standardmäßig Metadaten; nehmen Sie vollständige Rohausgaben nur nach Zustimmung auf und verifizieren Sie das exportierte Paket lokal.

So lesen Sie das Ergebnis

Das Ergebnis ist ein vom Nutzer bestätigtes Resultat, das an das fixierte Aufgabenpaket und die erfassten Konfigurationen gebunden ist. Standardmäßig werden nur Metadaten exportiert; ein vollständiger Export der Rohdaten erfordert eine ausdrückliche Zustimmung und kann von der lokalen Prüffunktion kontrolliert werden.

Was es nicht nachweisen kann

Das Ausblenden von Bezeichnungen verringert die Verzerrung durch sichtbare Namen, ist aber nicht doppelblind. OpenGPT betreibt die Anbieter nicht und belegt weder Ausgabeursprung, Konfigurationsgenauigkeit und Vollständigkeit noch den Datenschutz bei externen Anbietern oder die Übertragbarkeit über diese Aufgaben hinaus. Ergebnisse privater Versuche sind „An Ihrer Arbeit getestet“, nicht „Öffentlicher Nachweis“.

Häufige Frage: Lädt Proof Lab Prompts oder unbearbeitete Ausgaben hoch?

Der Test wird in Ihrem Browser ausgeführt. Im temporären Modus bleiben Rohausgaben im Arbeitsspeicher; ihre Aufbewahrung auf diesem Gerät ist optional. Der Metadatenexport schließt Rohausgaben aus und ein vollständiger Rohdatenexport erfordert eine ausdrückliche Zustimmung.

Nach oben
12

Gespeicherte Aufgabensätze und erneute Evaluation

Dieselben realen Prompts in einer späteren Modellevaluation wiederverwenden, ohne den Aufgabensatz neu zu erstellen.

Offen

Wofür diese Funktion gedacht ist

Gespeicherte Aufgabensätze verwenden, um künftige Vergleiche konsistenter zu gestalten und exakte Modellversionen nach einer Veröffentlichung oder Änderung öffentlicher Daten erneut zu evaluieren.

Bevor Sie beginnen

Vervollständigen Sie die Aufgabentitel und Prompts, wählen Sie einen eindeutigen Namen für das Aufgabenset und verwenden Sie denselben Browser und dasselbe Gerät. Ein Aufgabenset kann vertrauliche Arbeitstexte enthalten; entfernen Sie daher private Daten vor dem Speichern.

Schritt-für-Schritt-Anleitung

  1. 1Bereiten Sie in der Bewertung anhand realer Aufgaben ein Aufgabenset vor, das Ihre Arbeit abbildet, oder bearbeiten Sie es.
  2. 2Geben Sie dem Aufgabenset einen einprägsamen Namen und speichern Sie es.
  3. 3Wählen Sie später das gespeicherte Aufgabenset aus und laden Sie es in die aktuelle Bewertung.
  4. 4Wählen Sie zwei exakte Modellversionen aus und führen Sie jeden Prompt mit vergleichbaren Einstellungen aus.
  5. 5Wählen Sie bei einem abgeschlossenen Ergebnis „Neu bewerten“, um Aufgaben und Modellversionen beizubehalten und alte Antworten, Urteile sowie den vorherigen Bericht zu löschen.

So lesen Sie das Ergebnis

Name, Vorlage, Sprache, Aufgabentitel und Prompts des Aufgabensatzes werden zur Wiederverwendung lokal gespeichert. Eine erneute Bewertung startet einen neuen Durchlauf, behält jedoch die vorgesehenen Testeingaben bei.

Was es nicht nachweisen kann

Gespeicherte Aufgabensätze sind nur auf diesem Gerät vorhanden und werden weder synchronisiert noch gesichert. Antworten, Modellauswahl, Prüfungen, Berichte und API-Schlüssel werden nicht in einem Aufgabensatz gespeichert. Durch das Löschen der Websitedaten können alle gespeicherten Sätze entfernt werden.

Häufige Frage: Was ändert sich, wenn ich „Neu evaluieren“ auswähle?

OpenGPT behält dieselben Aufgaben und exakten Modellversionen bei und löscht anschließend frühere Antworten, Punktzahlen, Beurteilungen, den Aufdeckungsstatus und den Bericht, damit der nächste Durchlauf vom alten Ergebnis unabhängig ist.

Nach oben
13

Teilbarer Entscheidungsbericht

Erstellen Sie einen datenschutzgerechten Link für eine engere Auswahl offizieller Modelle und den Stichtag der öffentlichen Daten.

Offen

Wofür diese Funktion gedacht ist

Im Bericht mitteilen, welche Aufgabe und exakten offiziellen Versionen geprüft werden, welche öffentliche Evidenz verfügbar ist und welcher Kandidat optional ausgewählt wurde.

Bevor Sie beginnen

Erstellen Sie den Bericht aus einem Aufgabenranking. Bestätigen Sie vor dem Teilen die Aufgabe, die exakten Modell-IDs, den Datenstichtag und gegebenenfalls Ihre Auswahl.

Schritt-für-Schritt-Anleitung

  1. 1Öffnen Sie ein Aufgabenranking und erstellen Sie einen Bericht mit zwei oder drei offiziellen Kandidaten.
  2. 2Optional können Sie ein Modell als ausgewählt markieren; eine leere Auswahl ist zulässig.
  3. 3Abdeckung durch öffentliche Daten und Abgrenzung des Berichts prüfen.
  4. 4Kopieren Sie den Link, nutzen Sie die Teilen-Funktion des Geräts, drucken Sie ihn oder laden Sie den bereinigten JSON-Eintrag herunter.
  5. 5Ein Empfänger kann dieselbe Auswahlliste öffnen, öffentliche Daten vergleichen oder eine Bewertung anhand realer Aufgaben starten.

So lesen Sie das Ergebnis

Die geteilte URL enthält nur die Aufgaben-ID, die exakten offiziellen Modell-IDs, den Stichtag der öffentlichen Daten und optional das ausgewählte Modell, damit der Empfänger dieselbe Auswahlliste prüfen kann.

Was es nicht nachweisen kann

Der teilbare Bericht enthält keine Prompts, Modellantworten, Notizen, API-Schlüssel oder den vollständigen Bewertungsbericht. Er ist ein Auswahllistendatensatz und kein Beweis für einen allgemeingültigen Sieger oder eine authentifizierte Anbieterausgabe.

Häufige Frage: Kann jemand über den Freigabelink auf die Inhalte meiner Evaluation zugreifen?

Nein. Prompts, Antworten, Notizen, API-Schlüssel und das lokale Evaluierungsprojekt sind ausgeschlossen. Prüfen Sie den Link vor dem Teilen immer, wenn Sie außerhalb des unterstützten Berichtsablaufs Informationen hinzugefügt haben.

Nach oben
14

Berichtsverifizierung

Prüfen Sie unterstützte JSON-Berichte auf Struktur, interne Konsistenz, Muster geheimer Daten und einen lokalen Fingerabdruck.

Offen

Wofür diese Funktion gedacht ist

Mit dem Verifizierer ein Paket im Format OpenGPT Evidence v1 oder v2 oder einen aus Entscheidungsarbeitsbereich heruntergeladenen V3-Bericht prüfen. Jede Kontrolle wird lokal in diesem Browser ausgeführt.

Bevor Sie beginnen

Beschaffen Sie die ursprüngliche JSON-Datei. Laden Sie sie für einen Vergleichsbericht aus dem Entscheidungsarbeitsbereich herunter; schließen Sie zuvor alle Fälle ab, wenn Sie statt eines Entwurfs ein vollständiges Ergebnis benötigen.

Schritt-für-Schritt-Anleitung

  1. 1Wählen Sie die JSON-Datei aus; sie verbleibt in diesem Browser.
  2. 2Vergewissern Sie sich, dass das Prüfprogramm Evidence v1/v2, OpenGPT Private Comparison v1/v2 oder Entscheidungsarbeitsbereich v3 erkennt.
  3. 3Prüfen Sie bei Nachweispaketen Pflichtfelder, Durchläufe, Zeitstempel, Bewertungen und Sicherheitsprüfungen auf Geheimnisse. Prüfen Sie bei Vergleichsberichten die Kandidatennamen, die Aufgabensuite, den Entwurfs- oder Abschlussstatus, eindeutige Fälle und ob die Zusammenfassung mit den erfassten Urteilen übereinstimmt.
  4. 4Lesen Sie die deklarierte Zusammenfassung und speichern Sie den SHA-256-Fingerprint, wenn Sie später bestätigen müssen, dass exakt dieselbe Datei geprüft wird.
  5. 5Wenn eine Prüfung fehlschlägt, korrigieren Sie die Quelldaten oder schließen Sie die fehlenden Vergleichsfälle ab, anstatt den heruntergeladenen Bericht zu bearbeiten, um ein Bestehen zu erzwingen.

So lesen Sie das Ergebnis

Bei Evidence v1/v2 bedeutet „Bestanden“, dass das Paket die unterstützten Struktur- und Konsistenzregeln erfüllt; „Demo“ kennzeichnet ein Beispiel. Bei einem Vergleichsbericht bedeutet „Bestanden“, dass ein abgeschlossener Bericht intern konsistent ist; „Entwurf“ bedeutet, dass seine Struktur gültig, der Vergleich aber noch nicht abgeschlossen ist. „Fehlgeschlagen“ bedeutet, dass mindestens eine erforderliche Prüfung überprüft werden muss.

Was es nicht nachweisen kann

Das Bestehen eines Tests beweist nicht, dass das genannte Modell die eingefügten Antworten generiert hat, dass die Angaben des Anbieters zutreffen oder dass das Ergebnis über die aufgezeichneten Tests hinaus verallgemeinerbar ist. Ergebnisse aus nicht zusammenhängenden Dateien sind nicht automatisch vergleichbar.

Häufige Frage: Belegt ein bestandener Vergleichsbericht, dass ein Modell besser ist?

Nein. Es bestätigt nur, dass der unterstützte Bericht strukturell gültig und intern konsistent ist. Sie müssen Modellidentität, Testqualität, Ausgaben und Entscheidungsrelevanz weiterhin selbst beurteilen.

Nach oben
15

Bewertungsmethodik

Erfahren Sie, was eine Modellentscheidung überprüfbar und reproduzierbar macht.

Offen

Wofür diese Funktion gedacht ist

Diese Seite verwenden, bevor Sie eine Evaluation entwerfen, veröffentlichen oder sich darauf verlassen. Sie trennt Evidenzqualität von Modellpopularität.

Bevor Sie beginnen

Beginnen Sie mit einer konkreten Entscheidungsfrage, benannten Modellversionen, repräsentativen Aufgaben und einem Plan zur Aufbewahrung der Rohausgaben.

Schritt-für-Schritt-Anleitung

  1. 1Entscheidung und Erfolgskriterien formulieren, bevor die Ergebnisse angezeigt werden.
  2. 2Für jeden Kandidaten denselben Aufgabensatz, dieselben Einstellungen und Bewertungsregeln verwenden.
  3. 3Prompts, Ausgaben, Einstellungen, Fehler, Zeitstempel und Suite-Fingerprints beibehalten.
  4. 4Geben Sie an, was manuell oder automatisiert erfolgte, mit ausgeblendeten Modellbezeichnungen geprüft, randomisiert oder unabhängig reproduziert wurde.
  5. 5Veröffentlichen Sie Schlussfolgerungen zusammen mit Unsicherheiten und ausdrücklichen Einschränkungen.

So lesen Sie das Ergebnis

Evidence v1/v2 prüft vor allem Format und Deklarationen. Entscheidungsarbeitsbereich V3 unterstützt die lokale Neuberechnung (L3); eine unabhängige Reproduktion auf L4 wird weiterhin nicht unterstützt.

Was es nicht nachweisen kann

Ein strenges Verfahren kann Verzerrungen (Bias) reduzieren, aber nicht garantieren, dass eine Stichprobe jeden Nutzer, jede Sprache, jede zukünftige Version oder jede Produktionsbedingung repräsentiert.

Häufige Frage: Ist immer eine höhere Nachweisstufe erforderlich?

Passen Sie die Prüftiefe an die Folgen an. Für einen persönlichen Versuch kann L1 genügen; eine öffentliche oder risikoreiche Behauptung sollte durch stärkere unabhängige Nachweise gestützt werden.

Nach oben

Glossar in verständlicher Sprache

Diese Definitionen verwenden, wenn eine Bezeichnung nicht vertraut ist.

Quelldatensatz
Eine aus einem veröffentlichten Ranking übernommene Zeile, bei der das Quellmodell ID oder der Name für Überprüfungs- und Audit-Zwecke unverändert beibehalten wurde.
Offizielle Modell-ID
Eine vom Anbieter dokumentierte Modellkennung (OpenGPT), die getrennt vom Namen des Quelldatensatzes geführt wird.
Katalogversion
Eine Modellversion, die in der Dokumentation des Anbieters aufgeführt ist, einschließlich ihrer offiziellen Zielumgebung und der Quelle für die Überprüfung.
Wahrscheinliche Bewertungsspanne
Ein veröffentlichtes Unsicherheitsintervall für den angezeigten Wert. Größere Intervalle deuten auf eine geringere Genauigkeit hin; Werte aus verschiedenen Ranglisten sind nicht direkt vergleichbar.
Meine Modelle
Eine Auswahlliste, die nur in diesem Browser gespeichert ist. Es handelt sich weder um ein Benutzerkonto noch um eine Cloud-Synchronisierung oder ein Lesezeichen des Anbieters.
Eignung für die Anforderungen
Eine qualitative Einstufung der Eignung für einen Anwendungsbereich sowie die Anzahl der erfüllten Anforderungen; keine Bewertung einzelner Versionen. Prüfen Sie die Verfügbarkeit und vergleichen Sie die exakten Versionen anhand derselben Aufgaben.
Modellfamilie
Eine Gruppe zusammengehöriger Modellversionen. Fähigkeiten, Preise und Zugriffsmöglichkeiten können je nach Version variieren.
Benchmark
Ein reproduzierbares Set an Aufgaben und Bewertungsregeln, das zum Vergleich von Systemen unter definierten Bedingungen dient.
Agentenkonfiguration
Basismodell, Gerüst, Tools, Berechtigungen, Budget, Umgebung, Benchmark-Version und Datum, die zu einem Agent-Ergebnis geführt haben.
Nachweisqualität
Eine Bezeichnung, die beschreibt, wie ein Ergebnis erzielt oder überprüft wurde. Sie verändert nicht den ursprünglichen Score.
Kosten pro Erfolg
Gemeldete Evaluierungskosten geteilt durch erfolgreiche Aufgaben. Sie werden nur angezeigt, wenn vergleichbare Quelldaten vorliegen; fehlende Kosten sind nicht null.
Nachweisdatei
Ein strukturierter Datensatz, der darlegt, wie eine Evaluierung durchgeführt wurde und welche Ergebnisse sie lieferte.
Schema
Die maschinenlesbaren Regeln, die erforderliche Felder und zulässige Werte in einer Datei definieren.
SHA-256-Fingerabdruck
Eine lokale Kennung für die exakten Bytes einer Datei; eine Änderung der Datei verändert auch den Fingerabdruck.

Fehlerbehebung

Kein Modell erfüllt alle Anforderungen

Prüfen, welche Anforderung die einzelnen Kandidaten ausgeschlossen hat, und anschließend nur eine tatsächlich flexible Beschränkung lockern.

Anforderungen prüfen

Eine Rangnummer aus der Quelle wird übersprungen.

Der Herausgeber kann Ranggleichstände oder mehrere Konfigurationen verwenden. OpenGPT bewahrt die ursprüngliche Position, statt die sichtbaren Zeilen neu zu nummerieren.

Rangliste prüfen

Bei einem Agenten-Ergebnis fehlen Angaben zu Kosten oder Zuverlässigkeit.

Die Quelle hat keinen vergleichbaren Wert veröffentlicht. OpenGPT weist ihn nicht aus, statt ihn als null zu behandeln; vergleichen Sie nur Werte mit demselben Benchmark-Umfang.

Agent-Evidenz prüfen

Eine Zeile ohne offizielles Modell ID

Es handelt sich um einen vollständigen Quelldatensatz und nicht um einen ungeklärten Status. Öffnen Sie die Originalquelle; verwenden Sie das Modellverzeichnis, wenn Sie eine vom Anbieter dokumentierte Identität und offiziellen Zugriff benötigen.

Quellidentität prüfen

„Meine Modelle“ ist leer oder verschwunden

Dasselbe Browserprofil und Gerät verwenden. Der private Modus, blockierter Speicher oder das Löschen von Websitedaten können die lokale Liste entfernen.

„Meine Modelle“ öffnen

Ein Datensatz kann nicht zum Datenvergleich hinzugefügt werden.

Der Datenvergleich akzeptiert Modell-IDs aus dem Katalog. Möglicherweise ist dasselbe Modell bereits ausgewählt oder die Höchstzahl von vier Modellen erreicht. Wählen Sie eine andere Katalogversion oder entfernen Sie zuerst einen Kandidaten.

Modellverzeichnis öffnen

Der Test in Proof Lab ist unvollständig

Kehren Sie zum Test zurück und vervollständigen Sie für jede erforderliche Konfiguration und Aufgabe die Ausgabe, den Prüfstatus, die Kontrolle auf kritische Fehler und das vom Benutzer bestätigte Ergebnis.

Proof Lab fortsetzen

Ein lokaler Entwurf steht in Konflikt oder muss zurückgesetzt werden.

Kehren Sie zum Vergleich zurück, prüfen Sie die Warnung zum neueren lokalen Entwurf und entscheiden Sie dann bewusst, ob Sie den Entwurf behalten oder zurücksetzen.

Lokalen Entwurf prüfen

Eine Nachweisdatei schlägt fehl.

Den fehlgeschlagenen Checklistenpunkt verwenden, um den Quelldatensatz zu korrigieren. Fügen Sie keine Geheimnisse ein und formulieren Sie Ergebnisse nicht um.

Prüftool öffnen
contact@opengpt.com

Benötigen Sie weiterhin Hilfe?

Melden Sie einen defekten Link, ein falsches Modelldetail oder ein Problem, das Sie nicht lösen konnten.

Support per E-Mail