Kein Modell erfüllt alle Anforderungen
Prüfen, welche Anforderung die einzelnen Kandidaten ausgeschlossen hat, und anschließend nur eine tatsächlich flexible Beschränkung lockern.
Anforderungen prüfenFinden Sie den passenden Ablauf, folgen Sie jedem Schritt und verstehen Sie, was das Ergebnis aussagen kann – und was nicht.
Jeder Arbeitsablauf beantwortet eine andere Frage. Beginnen Sie mit dem passendsten Ziel und folgen Sie anschließend dem verknüpften Leitfaden.
Sehen Sie, was in die Rangliste eingeht, woher die Daten stammen und welche Datensätze eine offizielle Modell-ID enthalten.
Jede Ranglistenperspektive nutzen, um veröffentlichte Signale zu untersuchen, Quelldatensätze zu prüfen und eine Auswahlliste für Tests mit realen Aufgaben zu erstellen.
Beginnen Sie mit der Frage, die Sie beantworten müssen. Nutzerpräferenz, Gesamtleistung, objektive Aufgaben, Kosten und Open-Weight-Ranglisten verwenden unterschiedliche Quellen und Skalen.
Ein Rang bezieht sich auf eine bestimmte Quelle und einen bestimmten Anwendungsbereich. Bei Gleichständen können Rangnummern übersprungen werden; Werte aus unterschiedlichen Bewertungskategorien sind nicht direkt vergleichbar.
OpenGPT ordnet öffentliche Daten Dritter und hat diese Evaluierungen nicht erneut ausgeführt. Kein Ranking ermittelt für jeden Nutzer oder jede Aufgabe das beste Modell.
Jede Zeile enthält nun Modelldetails und eine Vergleichsaktion. OpenGPT ergänzt nur dann eine offizielle Modell-ID, wenn die Anbieterdokumentation die exakte Zuordnung belegt; andernfalls bleiben beim Vergleich von Quelldatensätzen Herausgebername, Konfiguration und Ranglistendaten erhalten, ohne eine neue offizielle ID zu erfinden.
Wählen Sie einen Agenten anhand von Aufgabe, vollständiger Konfiguration, Belegqualität und vergleichbaren Ergebnissen.
Erkunden Sie 96 veröffentlichte Agenten-Bewertungskonfigurationen aus sieben Aufgabenbereichen sowie 109 separate BFCL-Ergebnisse für Tool-Aufrufe, ohne inkompatible Nachweise zu einer einzigen Bewertung zusammenzufassen.
Ein Agenten-Ergebnis gehört zu einer vollständigen Konfiguration: Basismodell, Gerüst (Scaffold), Tools, Berechtigungen, Budget, Umgebung, Benchmark-Version und Datum. OpenGPT behält die von der Quelle gemeldeten Felder bei und lässt fehlende Felder unberücksichtigt – sie werden nicht als Nullwert geführt.
Ein Rang bezieht sich auf eine vollständige Systemkonfiguration innerhalb eines bestimmten Benchmark-Bereichs. Berücksichtigen Sie dabei auch den Grad der Nachweisbarkeit, die Aktualität, die Anzahl der Stichproben oder Testläufe sowie Angaben zu Kosten und Zuverlässigkeit.
OpenGPT erstellt keine universelle Agent-Punktzahl. Sofern ein Ergebnis nicht ausdrücklich als reproduziert gekennzeichnet ist, ordnet OpenGPT Belege aus vorgelagerten Quellen, statt die Evaluierung erneut auszuführen; kein Benchmark belegt die Produktionsreife für jeden Workflow.
Ein anderes Grundgerüst (Scaffold), eine andere Modellversion, ein anderes Toolset, eine andere Berechtigungsstufe, ein anderes Budget oder eine andere Benchmark-Einstellung führen zu einer abweichenden Agentenkonfiguration und müssen als separater Datensatz geführt werden.
Einen öffentlichen Identitäts- oder Evidenzdatensatz zur Prüfung senden, ohne die Ranglisten zu ändern.
Den Einreichungsablauf verwenden, wenn eine offizielle Modell-ID oder ein Agent-Produkt fehlt oder wenn eine öffentliche Quelle redaktionell geprüft werden muss.
Melden Sie sich mit einem verifizierten Konto an und halten Sie eine öffentliche HTTPS-Quelle bereit. Reichen Sie niemals Zugangsdaten, private Dateien oder personenbezogene Daten ein.
Eine erfolgreiche Einreichung erhält eine Referenznummer und gelangt in die Prüfwarteschlange. Ein genehmigtes Agenten-Produkt ist ein öffentlicher Verzeichniseintrag, kein Rang in einer Bestenliste und keine Zertifizierung gemäß OpenGPT.
Einreichende können Rang, Evidenzstufe, Vergleichbarkeit oder Veröffentlichungsstatus nicht festlegen. Duplikat- und Ratenlimits verringern Missbrauch und eine Genehmigung ändert eine Rangfolge nie automatisch.
Zugelassene Agentenprodukte sind im Verzeichnis auffindbar; für ein Ranking sind jedoch weiterhin vergleichbare öffentliche Evaluationsbelege erforderlich.
Bewegungen zwischen vergleichbaren Snapshots verfolgen und Modell-IDs im Katalog vergleichen.
Auf dieser Seite sehen, was sich seit dem vorherigen Quellsnapshot verändert hat, welche Datensätze erstmals erschienen sind, wie sich exakte Versionen unterscheiden und wann Daten abgerufen wurden.
Die historische Entwicklung verwendet derzeit den Bereich der LMArena-Nutzerpräferenzen. Andere aktive Quellen zeigen nur den aktuellen Stand, bis ein vergleichbarer früherer Snapshot vorliegt.
OpenGPT berechnet Veränderungen nur, wenn Quelle, Umfang, Einheit und Methode übereinstimmen, und bewahrt herunterladbare monatliche Snapshots auf.
Nur vom Anbieter dokumentierte Veröffentlichungsdaten gelten als Produktveröffentlichungen. Der Versionsvergleich leitet aus Namen weder Geschwindigkeit noch Preis, Kontextlänge oder Qualität ab.
OpenGPT hat für diese aktive Quelle noch keine vergleichbare frühere Ausgabe festgeschrieben. Pausierte Quellen bleiben historisch und tragen nicht zu aktuellen Veränderungen bei.
Mit einem realen Arbeitsszenario beginnen und drei offizielle Modellversionen prüfen, die zuerst getestet werden sollten.
Aufgabenranglisten verwenden, um breite öffentliche Signale in eine kleine, praktische Auswahlliste für Programmierung, Recherche, Dokumente, Support, mehrsprachige oder multimodale Arbeit, Kosten, Datenschutz oder Geschwindigkeit zu überführen.
Wählen Sie die Aufgabe, die Ihrer Arbeit am nächsten kommt, und notieren Sie anschließend Ihre tatsächlichen Prompts, Daten, Tools, Region, Ihr Budget und Ihre Datenschutzanforderungen. Die angezeigten öffentlichen Belege können einen breiteren Umfang als Ihre Aufgabe abdecken.
Sie erhalten drei offizielle Ausgangskandidaten, soweit verfügbar sichtbare öffentliche Evidenz und direkte Wege, einen Vergleich oder einen Test mit realen Aufgaben durchzuführen.
Ein aufgabenbezogenes Ranking ist eine erste Auswahlliste, kein universelles Ranking oder Nachweis für das beste Modell. Fehlende Nachweise werden nicht als Nullwert gewertet und – im Gegensatz zu öffentlichen Quellen – nicht zu einem Gesamtpunktwert zusammengefasst.
Eine offizielle Version kann für die Aufgabe relevant sein (aufgrund der Produktpositionierung oder Bereitstellungsart), auch wenn in der gewählten öffentlichen Quelle kein Ergebnis für die exakte Version hinterlegt ist. Der fehlende Nachweis bleibt sichtbar und muss durch eigene Tests geklärt werden.
Legen Sie die von Ihnen verwendeten Modelle, wiederkehrenden Arbeiten und Prioritäten fest und prüfen Sie anschließend vorsichtige Signale dafür, wann ein fairer Vergleich sinnvoll ist.
Mit dem Radar eine praktische Frage beantworten: Gibt es genügend vergleichbare öffentliche Evidenz, um eine Alternative zum derzeit verwendeten Modell zu testen?
Wählen Sie exakte offizielle Versionen, mindestens eine wiederkehrende Aufgabe und bis zu zwei Prioritäten. Verwenden Sie denselben Browser und dasselbe Gerät, da die Einrichtung lokal gespeichert bleibt.
Das Radar erstellt eine gerätelokale Upgrade-Prüfung mit einem aktuellen Modell, einer auf die Aufgabe abgestimmten Alternative, sofern verfügbar, dem Evidenzdatum, der Unsicherheitsgrenze und direkten Vergleichsaktionen.
Eine Upgrade-Prüfung ist keine Aufforderung zum Wechsel. Faktoren wie Kosten, Geschwindigkeit, Datenschutz oder Kontext können weiterhin direkte Tests erforderlich machen; zudem werden lokale Einstellungen nicht synchronisiert oder gesichert.
Nein. Es bedeutet, dass ein vergleichbares Signal oder eine Änderung im Lebenszyklus einen Test mit derselben Aufgabe sinnvoll macht. Wechseln Sie erst, wenn die Alternative bei Ihrer realen Arbeit und unter Ihren Bedingungen erfolgreich ist.
Vier praktische Anforderungen in eine nachvollziehbare Auswahlliste überführen.
Den Finder verwenden, wenn Sie wissen, welche Arbeit zu erledigen ist, aber nicht, welche Modellreihe Sie zuerst untersuchen sollten.
Klären Sie die Hauptaufgabe, wo das Modell ausgeführt werden darf, Ihre wichtigste betriebliche Priorität und etwaige Sprachanforderungen.
Die qualitative Bezeichnung und die Anzahl übereinstimmender Anforderungen gelten für die Modellreihe und nicht für einzelne Versionen; keines von beidem ist ein Benchmark-Wert. Prüfen Sie die Bereitstellungsverfügbarkeit jeder aufgeführten aktuellen Version und vergleichen Sie Kandidaten anhand derselben Aufgaben.
Der Finder ruft keine Modelle auf, überprüft keine aktuellen Preise und benennt keinen allgemeingültigen Sieger. Eine Modellreihe kann Versionen mit unterschiedlichen Fähigkeiten umfassen.
Die Reihenfolge spiegelt Ihre ausgewählten Rahmenbedingungen wider und nicht die allgemeine Beliebtheit. Ändern Sie eine Anforderung, um die Ursache des Ergebnisses zu erkennen, und testen Sie anschließend exakte Versionen.
Durchsuchen Sie vom Anbieter dokumentierte Modell-IDs, öffnen Sie eigene Detailseiten und prüfen Sie, ob vergleichbare öffentliche Ranking-Daten vorliegen.
Das Verzeichnis verwenden, wenn Sie eine exakte offizielle Modell-ID, ein Anbieterziel, geeignete und ungeeignete Aufgaben, Quellen und einen eindeutigen Status der Ranglistendaten benötigen.
Geben Sie einen Modellnamen, Anbieter, Bereitstellungsbedarf oder eine Aufgabe ein. Eine vom Anbieter dokumentierte Modell-ID garantiert keine vergleichbaren öffentlichen Evaluationsdaten.
„Mit Ranking“ bedeutet, dass mit dieser exakten Modell-ID vergleichbare veröffentlichte Daten verknüpft sind. „Ohne Ranking“ bedeutet, dass diese Ausgabe keinen geeigneten vergleichbaren Datensatz enthält; es handelt sich nicht um eine Punktzahl von null.
Die Anbieterdokumentation belegt die Katalogidentität, nicht die aktuelle Verfügbarkeit in jedem Land oder jeder Service-Stufe. Rankingabdeckung, Modelldetails und Anbieterbedingungen können sich nach dem Prüfdatum ändern.
Nein. Es bedeutet, dass diese Ausgabe für diese Modell-ID keine geeigneten vergleichbaren öffentlichen Daten enthält. Testen Sie das Modell direkt, wenn es für Ihre Entscheidung weiterhin relevant ist.
Vergleichen Sie zwei bis vier exakte offizielle Versionen oder Einträge aus einer veröffentlichten Rankingansicht.
Der Vergleich offizieller Versionen ordnet anbieterdokumentierte IDs über veröffentlichte Quellen hinweg. Der Vergleich von Quelldatensätzen bewahrt Namen und Einstellungen des Herausgebers, wenn bei einem exakten offiziellen Vergleich Informationen verloren gingen.
Wählen Sie für offizielle Versionen zwei bis vier Katalog-IDs. Wählen Sie für Quelldatensätze zwei bis vier Zeilen aus derselben Quelle, Dimension und demselben Snapshot.
Der Vergleich erstellt eine evidenzbewusste Auswahlliste und zeigt, wo Informationen fehlen. Er erzeugt weder einen neuen Benchmark-Wert noch erklärt er einen allgemeingültigen Sieger.
OpenGPT ruft die Modelle in dieser Ansicht nicht auf. Veröffentlichte Punktzahlen aus verschiedenen Quellen oder Umfängen sind nicht austauschbar, und Modelldetails können sich nach ihrem Prüfdatum ändern.
Der Datenvergleich fasst bereits veröffentlichte Informationen zu zwei bis vier Modellen zusammen. Die Evaluierung anhand realer Aufgaben verwendet genau zwei Versionen, fordert Sie auf, dieselben Prompts in beiden Diensten auszuführen, und prüft die eingefügten Antworten bei ausgeblendeten Modellbezeichnungen.
Führen Sie in diesem Browser eine kleine Arbeitsliste mit Ranglisteneinträgen.
Gespeicherte Modelle verwenden, um schnell zu Kandidaten zurückzukehren, vertrauenswürdige Ziele zu öffnen und unterstützte Modell-IDs in einen Vergleich zu übernehmen.
Denselben Browser und dasselbe Gerät verwenden. Die Liste wird lokal gespeichert, ohne OpenGPT-Konto oder Cloud-Synchronisierung.
Die Zahl neben Gespeicherte Modelle zeigt, wie viele Einträge gespeichert sind. Quellenidentität und offizielle Modellidentität bleiben getrennt.
Die Liste ist weder ein Konto noch eine Lesezeichensynchronisierung oder Sicherung. In einem anderen Browser oder auf einem anderen Gerät ist sie nicht sichtbar und durch privates Surfen, Speicherbeschränkungen oder das Löschen von Websitedaten kann sie entfernt werden.
Prüfen Sie, ob Sie dasselbe Browser-Profil und Gerät verwenden. Wurde der Website-Speicher gelöscht oder blockiert, kann OpenGPT die lokale Liste nicht wiederherstellen.
Einen privaten Test mit realer Arbeit durchführen; im temporären Modus bleiben Rohausgaben im Arbeitsspeicher, sofern Sie sie nicht bewusst auf diesem Gerät aufbewahren.
2–4 exakte Modell- oder Agentenkonfigurationen mit einem kontrollierten, nachvollziehbaren Aufgabenpaket vergleichen.
Erfassen Sie jede exakte Konfiguration, öffnen Sie die relevanten Anbieterdienste, entfernen Sie sensible Daten und beachten Sie, dass für alle dort übermittelten Inhalte die Anbieterrichtlinien gelten.
Das Ergebnis ist ein vom Nutzer bestätigtes Resultat, das an das fixierte Aufgabenpaket und die erfassten Konfigurationen gebunden ist. Standardmäßig werden nur Metadaten exportiert; ein vollständiger Export der Rohdaten erfordert eine ausdrückliche Zustimmung und kann von der lokalen Prüffunktion kontrolliert werden.
Das Ausblenden von Bezeichnungen verringert die Verzerrung durch sichtbare Namen, ist aber nicht doppelblind. OpenGPT betreibt die Anbieter nicht und belegt weder Ausgabeursprung, Konfigurationsgenauigkeit und Vollständigkeit noch den Datenschutz bei externen Anbietern oder die Übertragbarkeit über diese Aufgaben hinaus. Ergebnisse privater Versuche sind „An Ihrer Arbeit getestet“, nicht „Öffentlicher Nachweis“.
Der Test wird in Ihrem Browser ausgeführt. Im temporären Modus bleiben Rohausgaben im Arbeitsspeicher; ihre Aufbewahrung auf diesem Gerät ist optional. Der Metadatenexport schließt Rohausgaben aus und ein vollständiger Rohdatenexport erfordert eine ausdrückliche Zustimmung.
Dieselben realen Prompts in einer späteren Modellevaluation wiederverwenden, ohne den Aufgabensatz neu zu erstellen.
Gespeicherte Aufgabensätze verwenden, um künftige Vergleiche konsistenter zu gestalten und exakte Modellversionen nach einer Veröffentlichung oder Änderung öffentlicher Daten erneut zu evaluieren.
Vervollständigen Sie die Aufgabentitel und Prompts, wählen Sie einen eindeutigen Namen für das Aufgabenset und verwenden Sie denselben Browser und dasselbe Gerät. Ein Aufgabenset kann vertrauliche Arbeitstexte enthalten; entfernen Sie daher private Daten vor dem Speichern.
Name, Vorlage, Sprache, Aufgabentitel und Prompts des Aufgabensatzes werden zur Wiederverwendung lokal gespeichert. Eine erneute Bewertung startet einen neuen Durchlauf, behält jedoch die vorgesehenen Testeingaben bei.
Gespeicherte Aufgabensätze sind nur auf diesem Gerät vorhanden und werden weder synchronisiert noch gesichert. Antworten, Modellauswahl, Prüfungen, Berichte und API-Schlüssel werden nicht in einem Aufgabensatz gespeichert. Durch das Löschen der Websitedaten können alle gespeicherten Sätze entfernt werden.
OpenGPT behält dieselben Aufgaben und exakten Modellversionen bei und löscht anschließend frühere Antworten, Punktzahlen, Beurteilungen, den Aufdeckungsstatus und den Bericht, damit der nächste Durchlauf vom alten Ergebnis unabhängig ist.
Prüfen Sie unterstützte JSON-Berichte auf Struktur, interne Konsistenz, Muster geheimer Daten und einen lokalen Fingerabdruck.
Mit dem Verifizierer ein Paket im Format OpenGPT Evidence v1 oder v2 oder einen aus Entscheidungsarbeitsbereich heruntergeladenen V3-Bericht prüfen. Jede Kontrolle wird lokal in diesem Browser ausgeführt.
Beschaffen Sie die ursprüngliche JSON-Datei. Laden Sie sie für einen Vergleichsbericht aus dem Entscheidungsarbeitsbereich herunter; schließen Sie zuvor alle Fälle ab, wenn Sie statt eines Entwurfs ein vollständiges Ergebnis benötigen.
Bei Evidence v1/v2 bedeutet „Bestanden“, dass das Paket die unterstützten Struktur- und Konsistenzregeln erfüllt; „Demo“ kennzeichnet ein Beispiel. Bei einem Vergleichsbericht bedeutet „Bestanden“, dass ein abgeschlossener Bericht intern konsistent ist; „Entwurf“ bedeutet, dass seine Struktur gültig, der Vergleich aber noch nicht abgeschlossen ist. „Fehlgeschlagen“ bedeutet, dass mindestens eine erforderliche Prüfung überprüft werden muss.
Das Bestehen eines Tests beweist nicht, dass das genannte Modell die eingefügten Antworten generiert hat, dass die Angaben des Anbieters zutreffen oder dass das Ergebnis über die aufgezeichneten Tests hinaus verallgemeinerbar ist. Ergebnisse aus nicht zusammenhängenden Dateien sind nicht automatisch vergleichbar.
Nein. Es bestätigt nur, dass der unterstützte Bericht strukturell gültig und intern konsistent ist. Sie müssen Modellidentität, Testqualität, Ausgaben und Entscheidungsrelevanz weiterhin selbst beurteilen.
Erfahren Sie, was eine Modellentscheidung überprüfbar und reproduzierbar macht.
Diese Seite verwenden, bevor Sie eine Evaluation entwerfen, veröffentlichen oder sich darauf verlassen. Sie trennt Evidenzqualität von Modellpopularität.
Beginnen Sie mit einer konkreten Entscheidungsfrage, benannten Modellversionen, repräsentativen Aufgaben und einem Plan zur Aufbewahrung der Rohausgaben.
Evidence v1/v2 prüft vor allem Format und Deklarationen. Entscheidungsarbeitsbereich V3 unterstützt die lokale Neuberechnung (L3); eine unabhängige Reproduktion auf L4 wird weiterhin nicht unterstützt.
Ein strenges Verfahren kann Verzerrungen (Bias) reduzieren, aber nicht garantieren, dass eine Stichprobe jeden Nutzer, jede Sprache, jede zukünftige Version oder jede Produktionsbedingung repräsentiert.
Passen Sie die Prüftiefe an die Folgen an. Für einen persönlichen Versuch kann L1 genügen; eine öffentliche oder risikoreiche Behauptung sollte durch stärkere unabhängige Nachweise gestützt werden.
Diese Definitionen verwenden, wenn eine Bezeichnung nicht vertraut ist.
Prüfen, welche Anforderung die einzelnen Kandidaten ausgeschlossen hat, und anschließend nur eine tatsächlich flexible Beschränkung lockern.
Anforderungen prüfenDer Herausgeber kann Ranggleichstände oder mehrere Konfigurationen verwenden. OpenGPT bewahrt die ursprüngliche Position, statt die sichtbaren Zeilen neu zu nummerieren.
Rangliste prüfenDie Quelle hat keinen vergleichbaren Wert veröffentlicht. OpenGPT weist ihn nicht aus, statt ihn als null zu behandeln; vergleichen Sie nur Werte mit demselben Benchmark-Umfang.
Agent-Evidenz prüfenEs handelt sich um einen vollständigen Quelldatensatz und nicht um einen ungeklärten Status. Öffnen Sie die Originalquelle; verwenden Sie das Modellverzeichnis, wenn Sie eine vom Anbieter dokumentierte Identität und offiziellen Zugriff benötigen.
Quellidentität prüfenDasselbe Browserprofil und Gerät verwenden. Der private Modus, blockierter Speicher oder das Löschen von Websitedaten können die lokale Liste entfernen.
„Meine Modelle“ öffnenDer Datenvergleich akzeptiert Modell-IDs aus dem Katalog. Möglicherweise ist dasselbe Modell bereits ausgewählt oder die Höchstzahl von vier Modellen erreicht. Wählen Sie eine andere Katalogversion oder entfernen Sie zuerst einen Kandidaten.
Modellverzeichnis öffnenKehren Sie zum Test zurück und vervollständigen Sie für jede erforderliche Konfiguration und Aufgabe die Ausgabe, den Prüfstatus, die Kontrolle auf kritische Fehler und das vom Benutzer bestätigte Ergebnis.
Proof Lab fortsetzenKehren Sie zum Vergleich zurück, prüfen Sie die Warnung zum neueren lokalen Entwurf und entscheiden Sie dann bewusst, ob Sie den Entwurf behalten oder zurücksetzen.
Lokalen Entwurf prüfenDen fehlgeschlagenen Checklistenpunkt verwenden, um den Quelldatensatz zu korrigieren. Fügen Sie keine Geheimnisse ein und formulieren Sie Ergebnisse nicht um.
Prüftool öffnenMelden Sie einen defekten Link, ein falsches Modelldetail oder ein Problem, das Sie nicht lösen konnten.