GUÍAS Y ASISTENCIA

Centro de ayuda de OpenGPT

Encuentra el flujo de trabajo adecuado, sigue cada paso y entiende qué puede demostrar el resultado y qué no.

Empiece con lo que quiere hacer

Cada flujo de trabajo responde a una pregunta distinta. Empieza por el objetivo más cercano y sigue después la guía enlazada.

1Clasificaciones de modelosComprende las señales publicadas y el estado de la identidad.2Clasificaciones de AgentsElige configuraciones completas de Agents según la tarea y la evidencia.3ElegirReduce los candidatos a partir de requisitos reales.4Comparar datos públicosColoca en paralelo entre dos y cuatro IDs de modelos del catálogo.5Guardar modelosMantén una lista local de preselección en este navegador.6Ejecutar una prueba de Proof LabPruebe entre 2 y 4 configuraciones exactas de modelos o Agent con un paquete de tareas congelado.7Enviar o corregir evidenciasEnvíe una fuente pública de un modelo o Agent para revisión editorial.8Verificar un informeComprueba localmente un informe JSON de OpenGPT antes de compartirlo.

01

Clasificaciones de modelos de AI

Vea qué se clasifica, de dónde proceden los datos y qué registros incluyen un ID oficial de modelo.

Abrir

Para qué sirve esta función

Usa cada enfoque de clasificación para examinar las señales publicadas, revisar los registros de las fuentes y crear una lista de preselección para realizar pruebas con tareas reales.

Antes de empezar

Empiece con la pregunta que necesita responder. Las preferencias de los usuarios, la capacidad general, las tareas objetivas, el coste y las clasificaciones de pesos abiertos utilizan fuentes y escalas diferentes.

Tutorial paso a paso

  1. 1Elige el enfoque de clasificación que mejor se adapte a tu decisión.
  2. 2Usa Clasificación completa de la fuente para ver todos los registros del editor, o ID oficiales de modelos para los registros vinculados mediante documentación del proveedor.
  3. 3Considera conjuntamente la posición en la fuente, el intervalo de puntuación, los votos, la licencia y la configuración.
  4. 4Abre los detalles del modelo en cualquier fila. Las correspondencias oficiales exactas usan el perfil oficial; las demás filas abren un perfil de fuente que conserva el nombre y la configuración publicados.
  5. 5Añada cualquier fila a la comparación. Las asignaciones exactas y seguras para la configuración usan la comparación de versiones oficiales; las demás filas usan la comparación de registros de origen dentro de la misma fuente, dimensión e instantánea.

Cómo interpretar el resultado

Una posición es relativa a una fuente y un alcance. Los empates pueden hacer que se omitan números de posición y las puntuaciones de distintos enfoques de clasificación no son directamente comparables.

Qué no puede demostrar

OpenGPT organiza datos públicos de terceros y no ha repetido estas evaluaciones. Ninguna clasificación identifica el mejor modelo para todos los usuarios o tareas.

Pregunta habitual: ¿Por qué algunas filas muestran únicamente un ID o nombre de modelo de la fuente?

Ahora cada fila incluye los detalles del modelo y una acción de comparación. OpenGPT solo añade un ID oficial de modelo cuando la documentación del proveedor demuestra la correspondencia exacta; de lo contrario, la comparación del registro de origen conserva el nombre, la configuración y los datos de clasificación publicados, sin inventar un nuevo ID oficial.

Volver arriba
02

Clasificaciones de Agents de AI

Elige un Agent según la tarea, la configuración completa, la calidad de la evidencia y los resultados comparables.

Abrir

Para qué sirve esta función

Explora 96 configuraciones publicadas de evaluación de agentes en siete ámbitos de tareas, además de 109 resultados independientes BFCL de modelos en uso de herramientas, sin convertir evidencias incompatibles en una única puntuación.

Antes de empezar

El resultado de un agente pertenece a una configuración completa: modelo base, scaffold, herramientas, permisos, presupuesto, entorno, versión del benchmark y fecha. OpenGPT conserva los campos comunicados por la fuente y deja sin informar los que faltan; no los considera cero.

Tutorial paso a paso

  1. 1Elige la categoría de tareas que corresponda a tu trabajo.
  2. 2Comprueba el alcance y la versión del benchmark, la fecha de evaluación, la vigencia y la nota de auditoría antes de interpretar la posición.
  3. 3Usa el grado de evidencia para distinguir los resultados reproducidos o comprobados de las ejecuciones públicas transparentes y los resultados comunicados por proveedores.
  4. 4Compara el éxito, la evidencia de ejecuciones repetidas, la duración y la intervención únicamente cuando la fuente los comunique en las mismas condiciones. OpenGPT solo muestra el coste por éxito cuando el total publicado y el denominador de tareas o ejecuciones pertenecen al mismo ámbito verificado.
  5. 5Sigue las configuraciones útiles, consulta su historial y selecciona entre dos y cuatro entradas del mismo grupo comparable para verlas en paralelo.

Cómo interpretar el resultado

Una posición describe una configuración completa del sistema dentro del alcance de un benchmark. Interprétela junto con el grado de evidencia, la actualidad, el número de muestras o ejecuciones y los campos de coste y fiabilidad indicados.

Qué no puede demostrar

OpenGPT no crea una puntuación universal de agentes. Salvo que un resultado se marque expresamente como reproducido, OpenGPT organiza pruebas de terceros en lugar de repetirlas; ninguna prueba de referencia demuestra que un sistema esté listo para producción en todos los flujos de trabajo.

Pregunta habitual: ¿Por qué puede aparecer más de una vez el mismo Agent o modelo?

Un scaffold, una versión de modelo, un conjunto de herramientas, un nivel de permisos, un presupuesto o una configuración de benchmark diferentes crean una configuración de agente distinta y deben conservarse como un registro separado.

Volver arriba
03

Enviar un modelo o Agent

Envíe un registro público de identidad o evidencia para revisión sin modificar las clasificaciones.

Abrir

Para qué sirve esta función

Usa el flujo de envío cuando falte un ID oficial de modelo o un producto Agent, o cuando una fuente pública necesite revisión editorial.

Antes de empezar

Inicie sesión con una cuenta verificada y prepare una fuente HTTPS pública. Nunca envíe credenciales, archivos privados ni información personal.

Tutorial paso a paso

  1. 1Elige Modelo o Agent en la parte superior del formulario.
  2. 2Introduce el nombre público exacto, el proveedor o la organización y los campos de identidad solicitados.
  3. 3Elige el tipo de fuente y enlaza la documentación oficial, un repositorio público o un resultado público de benchmark.
  4. 4Explica qué debe verificar la persona revisora y envíalo una sola vez.
  5. 5Consulta el estado de revisión en tus envíos recientes. Los productos Agent aprobados se incluyen automáticamente en el directorio de Agents con función de búsqueda; la clasificación es independiente.

Cómo interpretar el resultado

Una entrega correcta recibe un número de referencia y entra en la cola de revisión. Un producto Agent aprobado es un registro del directorio público, no una posición en la clasificación ni una recomendación de OpenGPT.

Qué no puede demostrar

Los remitentes no pueden establecer la posición, el grado de evidencia, la comparabilidad ni el estado de publicación. Los límites de duplicados y frecuencia reducen los abusos, y la aprobación nunca modifica automáticamente una clasificación.

Pregunta habitual: ¿Por qué no se añadió a la clasificación un envío aprobado?

Los productos Agent aprobados se pueden buscar en el directorio, pero para clasificarlos sigue siendo necesario disponer de evidencia pública de evaluación comparable.

Volver arriba
04

Cambios de clasificación e historial de versiones

Sigue la evolución entre instantáneas comparables y compara los ID de modelos del catálogo.

Abrir

Para qué sirve esta función

Usa esta página para ver qué ha cambiado desde la instantánea anterior de la fuente, qué registros han aparecido por primera vez, en qué difieren las versiones exactas y cuándo se consultaron los datos.

Antes de empezar

El movimiento histórico utiliza actualmente el ámbito de preferencias de usuarios de LMArena. Las demás fuentes activas solo muestran el estado vigente hasta que exista una instantánea anterior comparable.

Tutorial paso a paso

  1. 1Comprueba la fecha de la fuente, la referencia de comparación, la fecha de consulta y la regla de comparación.
  2. 2Interpreta «Mayores ascensos» solo entre los registros presentes en ambas instantáneas.
  3. 3Trata «Primera aparición» como una nueva entrada de la fuente, no como una fecha oficial de lanzamiento.
  4. 4Filtra la tabla de movimientos por subida, bajada, sin cambios, primera aparición o retirada de la lista.
  5. 5Compara dos identificadores de modelos del catálogo y descarga después una instantánea de la fuente cuando necesites una pista de auditoría.

Cómo interpretar el resultado

OpenGPT solo calcula el movimiento cuando coinciden la fuente, el alcance, la unidad y el método, y conserva instantáneas mensuales descargables.

Qué no puede demostrar

Solo se consideran lanzamientos de producto las fechas de lanzamiento documentadas por el proveedor. La comparación de versiones no deduce la velocidad, el precio, la longitud del contexto ni la calidad a partir de los nombres.

Pregunta habitual: ¿Por qué LiveBench no muestra movimientos en la clasificación?

OpenGPT no ha fijado una edición anterior comparable para esta fuente activa. Las fuentes en pausa se conservan como históricas y no contribuyen al movimiento actual.

Volver arriba
05

Clasificaciones por tarea

Parta de un escenario de trabajo real y revise tres versiones oficiales de modelos que convenga probar primero.

Abrir

Para qué sirve esta función

Usa las clasificaciones por tareas para convertir señales públicas amplias en una lista de preselección pequeña y práctica para programación, investigación, documentos, soporte, trabajo multilingüe, trabajo multimodal, coste, privacidad o velocidad.

Antes de empezar

Elige la tarea más parecida a tu trabajo y anota después tus prompts, datos, herramientas, región, presupuesto y requisitos de privacidad reales. La evidencia pública mostrada puede abarcar un ámbito más amplio que tu tarea.

Tutorial paso a paso

  1. 1Abre el escenario de tarea que más se aproxime a la decisión que debes tomar.
  2. 2Lee por qué se seleccionaron las tres versiones oficiales y qué aspectos siguen siendo inciertos.
  3. 3Revisa la fuente pública, la posición o el valor de la fuente, la fecha de revisión de la correspondencia y la fecha límite de los datos de cada candidato.
  4. 4Seleccione dos o tres candidatos para una comparación paralela de datos públicos.
  5. 5Abre la evaluación con tareas reales usando los dos primeros candidatos, edita el conjunto de tareas de muestra y prueba ambos con ajustes comparables.

Cómo interpretar el resultado

Obtienes tres candidatos oficiales iniciales, evidencia pública visible cuando está disponible y rutas directas para comparar o ejecutar una prueba con tareas reales.

Qué no puede demostrar

Una clasificación por tarea es una preselección inicial, no una clasificación universal ni una prueba del mejor modelo. La ausencia de evidencia no equivale a cero y las fuentes públicas diferentes no se combinan en una sola puntuación.

Pregunta habitual: ¿Por qué puede un candidato inicial no tener un resultado público comparable?

Una versión oficial puede ser pertinente para la tarea por el posicionamiento del producto o el tipo de implementación, incluso cuando no se haya asignado ningún resultado de esa versión exacta en la fuente pública seleccionada. La falta de evidencia permanece visible y debe resolverse mediante una prueba propia.

Volver arriba
06

Radar de actualización de modelos

Defina los modelos que utiliza, el trabajo recurrente y las prioridades; después, revise señales prudentes para saber cuándo merece la pena realizar una comparación justa.

Abrir

Para qué sirve esta función

Usa el Radar para responder a una pregunta práctica: ¿existe evidencia pública comparable suficiente para probar una alternativa al modelo que utilizas actualmente?

Antes de empezar

Elige versiones oficiales exactas, al menos una tarea recurrente y hasta dos prioridades. Usa el mismo navegador y dispositivo, ya que la configuración permanece en local.

Tutorial paso a paso

  1. 1Elige las versiones oficiales exactas que utilizas actualmente; no se presupone que los modelos guardados sigan siendo actuales.
  2. 2Seleccione tareas recurrentes y hasta dos prioridades, como calidad, coste, velocidad, privacidad o contexto largo.
  3. 3Revise si conviene comparar cada modelo, mantenerlo bajo observación de forma segura o si se aproxima su retirada.
  4. 4Consulta evidencia pública comparable y, después, prueba ambos modelos con el mismo trabajo real.
  5. 5Revise los cambios semanales o suscríbase al canal RSS público de cambios en la clasificación.

Cómo interpretar el resultado

El Radar crea una comprobación de actualizaciones local en el dispositivo con un modelo actual, una alternativa adaptada a la tarea cuando está disponible, fecha de las evidencias, límites de incertidumbre y acciones de comparación directa.

Qué no puede demostrar

Una comprobación de actualización no es una instrucción para cambiar. El coste, la velocidad, la privacidad o el contexto aún pueden requerir pruebas directas, y la configuración local no se sincroniza ni se incluye en copias de seguridad.

Pregunta habitual: ¿«Merece la pena comparar» significa que debo sustituir mi modelo actual?

No. Significa que una señal comparable o un cambio en el ciclo de vida justifican repetir la prueba con la misma tarea. Cambia solo después de que la alternativa funcione satisfactoriamente con tu trabajo y tus restricciones reales.

Volver arriba
07

Elige un modelo de IA

Convierte cuatro requisitos prácticos en una lista de preselección explicable.

Abrir

Para qué sirve esta función

Usa el buscador cuando sepas qué trabajo necesitas realizar, pero no qué serie de modelos investigar primero.

Antes de empezar

Identifica la tarea principal, dónde puede ejecutarse el modelo, cuál es tu prioridad operativa más importante y si existe algún requisito lingüístico.

Tutorial paso a paso

  1. 1Elige la tarea más parecida a tu trabajo real.
  2. 2Defina el límite de implementación, en especial cuando los datos no puedan salir de su entorno.
  3. 3Elige la prioridad a la que menos estás dispuesto a renunciar.
  4. 4Defina la necesidad lingüística y, después, revise los motivos de coincidencia, los riesgos y el siguiente paso de validación para cada candidato.
  5. 5Lleve a los candidatos más sólidos a la evaluación con tareas reales y pruebe versiones exactas de los modelos con las mismas tareas.

Cómo interpretar el resultado

La etiqueta cualitativa y el número de coincidencias con los requisitos corresponden a la serie de modelos, no a versiones individuales; ninguno de los dos es una puntuación de benchmark. Verifique la disponibilidad de implementación de cada versión actual incluida y compare a los candidatos con las mismas tareas.

Qué no puede demostrar

El buscador no llama a modelos, verifica precios actuales ni designa un ganador universal. Una serie de modelos puede incluir versiones con distintas capacidades.

Pregunta habitual: ¿Por qué un modelo conocido no ha aparecido primero?

El orden refleja las restricciones que seleccionó, no la popularidad general. Cambie un requisito para ver qué causó el resultado y, después, pruebe versiones exactas.

Volver arriba
08

Directorio y detalles de los modelos

Explora los ID de modelos documentados por los proveedores, abre páginas de detalles específicas y comprueba si existen datos públicos de clasificación comparables.

Abrir

Para qué sirve esta función

Usa el directorio cuando necesites un ID oficial exacto de modelo, un destino del proveedor, tareas adecuadas y no adecuadas, fuentes y un estado claro de los datos de clasificación.

Antes de empezar

Introduce el nombre de un modelo, un proveedor, una necesidad de despliegue o una tarea. Que el proveedor documente un ID de modelo no garantiza que existan datos públicos de evaluación comparables.

Tutorial paso a paso

  1. 1Buscar por modelo, versión, proveedor o tarea.
  2. 2Filtra por método de despliegue y por estado: clasificado o sin clasificación actual.
  3. 3Abre la página de detalles de un modelo para revisar su identidad, uso previsto, cobertura de datos públicos, fortalezas, limitaciones, fuentes y fecha de revisión.
  4. 4Usa el destino oficial para verificar la disponibilidad, los precios, la privacidad y los límites actuales.
  5. 5Añada entre dos y cuatro versiones del catálogo a la comparación de datos y lleve después dos finalistas a la evaluación con tareas reales.

Cómo interpretar el resultado

«Clasificado» significa que hay datos publicados comparables vinculados a ese ID exacto de modelo. «Sin clasificar» significa que esta edición no contiene un registro comparable adecuado; no equivale a una puntuación de cero.

Qué no puede demostrar

La documentación del proveedor confirma la identidad del catálogo, pero no la disponibilidad actual en todos los países o niveles de servicio. La cobertura de las clasificaciones, los detalles de los modelos y las condiciones del proveedor pueden cambiar después de la fecha de revisión.

Pregunta habitual: ¿Que no tenga clasificación significa que el modelo es débil?

No. Significa que esta edición carece de datos públicos comparables adecuados para ese ID de modelo. Pruébalo directamente si sigue siendo pertinente para tu decisión.

Volver arriba
09

Comparación de datos

Compara entre dos y cuatro versiones oficiales exactas o registros de una única vista de clasificación publicada.

Abrir

Para qué sirve esta función

La comparación de versiones oficiales organiza los IDs documentados por el proveedor entre las fuentes publicadas. La comparación de registros de fuente conserva el nombre y los ajustes del editor cuando una comparación oficial exacta haría que se perdiera información.

Antes de empezar

Para las versiones oficiales, elige entre dos y cuatro ID del catálogo. Para los registros de origen, elige entre dos y cuatro filas de la misma fuente, dimensión e instantánea.

Tutorial paso a paso

  1. 1Añada cualquier fila de una clasificación. Las asignaciones seguras para la configuración usan la comparación de versiones oficiales; las demás filas usan la comparación de registros de origen.
  2. 2Los resultados oficiales se mantienen separados por fuente y dimensión.
  3. 3Los resultados de registros de fuentes conservan el nombre, los ajustes, la posición y la puntuación publicados en una escala común de la fuente.
  4. 4Los datos ausentes siguen figurando como desconocidos, no como cero.
  5. 5Solo las versiones oficiales exactas pueden pasar a una evaluación con tareas reales después de que elijas dos finalistas.

Cómo interpretar el resultado

La comparación crea una selección preliminar que tiene en cuenta las evidencias y muestra dónde falta información. No genera una nueva puntuación de benchmark ni declara un ganador universal.

Qué no puede demostrar

OpenGPT no llama a los modelos en esta vista. Las puntuaciones publicadas de fuentes o alcances distintos no son intercambiables, y los detalles de los modelos pueden cambiar después de su fecha de revisión.

Pregunta habitual: ¿En qué se diferencia la comparación de datos de la evaluación con tareas reales?

La comparación de datos resume información ya publicada sobre entre dos y cuatro modelos. La evaluación con tareas reales utiliza exactamente dos versiones, te pide ejecutar los mismos prompts en ambos servicios y revisa las respuestas pegadas ocultando las etiquetas visibles de los modelos.

Volver arriba
10

Modelos guardados

Mantén una pequeña lista de trabajo con entradas de la clasificación en este navegador.

Abrir

Para qué sirve esta función

Usa Modelos guardados para volver rápidamente a los candidatos, abrir destinos de confianza e incorporar a una comparación los ID de modelos compatibles.

Antes de empezar

Usa el mismo navegador y dispositivo. La lista se almacena localmente, sin una cuenta de OpenGPT ni sincronización en la nube.

Tutorial paso a paso

  1. 1Seleccione Guardar en cualquier fila de la clasificación.
  2. 2Abre Modelos guardados desde la barra de navegación superior para revisar las entradas guardadas.
  3. 3Cada registro de origen guardado muestra el ID o el nombre del modelo en la fuente. Los registros que disponen de un ID oficial de modelo también pueden abrir el destino del proveedor o añadirse a una comparación.
  4. 4Añada dos IDs de modelos compatibles diferentes y abra la comparación de datos públicos. Elija allí dos finalistas antes de iniciar una evaluación con tareas reales.
  5. 5Elimina las entradas que ya no necesites. Al actualizar o cambiar el idioma del sitio, la lista se conserva en el mismo navegador.

Cómo interpretar el resultado

El recuento junto a Modelos guardados muestra cuántas entradas se han guardado. La identidad de la fuente y la identidad oficial del modelo permanecen separadas.

Qué no puede demostrar

La lista no es una cuenta, una sincronización de marcadores ni una copia de seguridad. Otro navegador o dispositivo no la verá, y la navegación privada, las restricciones de almacenamiento o el borrado de los datos del sitio pueden eliminarla.

Pregunta habitual: ¿Por qué han desaparecido mis modelos guardados?

Comprueba que estás usando el mismo perfil del navegador y el mismo dispositivo. Si el almacenamiento del sitio se borró o bloqueó, OpenGPT no puede restaurar la lista local.

Volver arriba
11

Proof Lab

Ejecute una prueba privada con trabajo real; el modo temporal conserva los resultados brutos en la memoria, salvo que decida guardarlos en este dispositivo.

Abrir

Para qué sirve esta función

Compara entre 2 y 4 configuraciones exactas de modelos o Agents con un único Paquete de tareas controlado y auditable.

Antes de empezar

Registra cada configuración exacta, abre los servicios correspondientes del proveedor, elimina los datos sensibles y recuerda que sus políticas se aplican a todo lo que envíes allí.

Tutorial paso a paso

  1. 1Elige entre 2 y 4 configuraciones exactas de modelos o Agents; no trates un nombre de familia como una configuración reproducible.
  2. 2Carga una plantilla o crea un paquete de tareas editable; después, fíjalo antes de recopilar resultados.
  3. 3Ejecute usted mismo cada tarea congelada en todas las configuraciones y pegue cada resultado completo en la matriz.
  4. 4Usa una revisión equilibrada, a ciegas y de todos los pares. Registra Superado, No superado, No concluyente o No probado, además de los fallos críticos; conserva la latencia y el coste como observaciones independientes y no crees una puntuación general sintética.
  5. 5Revise las evidencias mostradas y confirme explícitamente el resultado de la decisión. Exporte los metadatos de forma predeterminada; incluya los resultados brutos completos solo después de obtener consentimiento y verifique localmente el paquete exportado.

Cómo interpretar el resultado

El resultado es un desenlace confirmado por el usuario, vinculado al paquete de tareas congelado y a las configuraciones registradas. De forma predeterminada, solo se exportan metadatos; exportar todos los datos brutos requiere consentimiento explícito y puede comprobarse con el verificador local.

Qué no puede demostrar

Ocultar las etiquetas reduce el sesgo por el nombre visible, pero no constituye una prueba de doble ciego. OpenGPT no ejecuta los servicios de los proveedores ni demuestra el origen de la salida, la exactitud de la configuración, su integridad, la privacidad de los proveedores externos o la generalización más allá de estas tareas. Los resultados de pruebas privadas son Probado con tu trabajo, no Evidencia pública.

Pregunta habitual: ¿Proof Lab carga los prompts o los resultados completos?

La prueba se ejecuta en su navegador. El modo temporal conserva los resultados brutos en la memoria; guardarlos en este dispositivo es opcional. La exportación de metadatos excluye los resultados brutos y su exportación completa requiere consentimiento explícito.

Volver arriba
12

Conjuntos de tareas guardados y reevaluación

Reutilice las mismas solicitudes reales en una evaluación de modelos posterior sin reconstruir el conjunto de tareas.

Abrir

Para qué sirve esta función

Usa conjuntos de tareas guardados para que las comparaciones futuras sean más coherentes y para volver a evaluar versiones exactas de modelos tras un lanzamiento o un cambio en los datos públicos.

Antes de empezar

Completa los títulos y las instrucciones de las tareas, elige un nombre claro para el conjunto y utiliza el mismo navegador y dispositivo. Un conjunto de tareas puede contener texto de trabajo confidencial; elimina los datos privados antes de guardarlo.

Tutorial paso a paso

  1. 1En Evaluación con tareas reales, prepara o edita un conjunto de tareas que represente tu trabajo.
  2. 2Da al conjunto de tareas un nombre reconocible y guárdalo.
  3. 3Más adelante, elige el conjunto de tareas guardado y cárgalo en la evaluación actual.
  4. 4Seleccione dos versiones exactas de modelos y ejecute cada solicitud con ajustes comparables.
  5. 5Desde un resultado finalizado, elige Volver a evaluar para conservar las tareas y las versiones de los modelos, pero borrar las respuestas, los criterios y el informe anterior.

Cómo interpretar el resultado

El nombre del conjunto de tareas, la plantilla, el idioma, los títulos de tareas y las solicitudes se almacenan localmente para reutilizarlos. La reevaluación inicia una ejecución limpia, pero conserva las entradas de prueba previstas.

Qué no puede demostrar

Los conjuntos de tareas guardados existen únicamente en este dispositivo y no se sincronizan ni se incluyen en copias de seguridad. Las respuestas, las selecciones de modelos, las revisiones, los informes y las claves de API no se guardan en un conjunto de tareas. Si borra los datos del sitio, puede perder todos los conjuntos guardados.

Pregunta habitual: ¿Qué cambia cuando elijo Volver a evaluar?

OpenGPT conserva las mismas tareas y versiones exactas de los modelos, y luego borra las respuestas, puntuaciones, valoraciones, estado de revelación e informe anteriores para que la nueva ejecución sea independiente del resultado previo.

Volver arriba
13

Informe de decisión para compartir

Crea un enlace que proteja la privacidad para una lista final de modelos oficiales y la fecha límite de sus datos públicos.

Abrir

Para qué sirve esta función

Usa el informe para comunicar qué tarea y qué versiones oficiales exactas se están considerando, la evidencia pública disponible y, opcionalmente, el candidato seleccionado.

Antes de empezar

Crea el informe desde una clasificación por tareas. Confirma la tarea, los identificadores exactos de los modelos, la fecha límite de los datos y la selección opcional antes de compartirlo.

Tutorial paso a paso

  1. 1Abre una clasificación por tareas y crea un informe con dos o tres candidatos oficiales.
  2. 2Si quieres, marca un modelo como seleccionado; también es válido dejar la elección en blanco.
  3. 3Revise la cobertura de datos públicos y los límites del informe.
  4. 4Copia el enlace, utiliza el menú para compartir del dispositivo, imprímelo o descarga el registro JSON saneado.
  5. 5Un destinatario puede abrir la misma lista de preselección, comparar datos públicos o iniciar una evaluación con tareas reales.

Cómo interpretar el resultado

La URL compartida contiene únicamente el ID de la tarea, los ID oficiales exactos de los modelos, la fecha límite de los datos públicos y el modelo seleccionado opcional, para que el destinatario pueda examinar la misma selección preliminar.

Qué no puede demostrar

El informe para compartir no contiene solicitudes, respuestas de modelos, notas, claves de API ni el informe de evaluación completo. Es un registro de selección preliminar, no una prueba de un ganador universal ni de un resultado autenticado del proveedor.

Pregunta habitual: ¿Puede alguien ver el contenido de mi evaluación desde el enlace compartido?

No. Se excluyen los prompts, las respuestas, las notas, las claves de API y el proyecto de evaluación local. Si has añadido información fuera del flujo de informes compatible, revisa siempre el enlace antes de compartirlo.

Volver arriba
14

Verificación del informe

Comprueba la estructura, la coherencia interna, los patrones de secretos y la huella local de los informes JSON compatibles.

Abrir

Para qué sirve esta función

Usa el verificador para examinar un paquete OpenGPT Evidence v1 o v2, o un informe V3 descargado de espacio de decisiones. Todas las comprobaciones se ejecutan localmente en este navegador.

Antes de empezar

Obtén el archivo JSON original. Para un informe de comparación, descárgalo desde el Espacio de decisiones; si necesitas un resultado completo en lugar de un borrador, termina antes todos los casos.

Tutorial paso a paso

  1. 1Elige el archivo JSON; permanecerá en este navegador.
  2. 2Confirma que el verificador reconoce Evidence v1/v2, OpenGPT private comparison v1/v2 o espacio de decisiones v3.
  3. 3En los paquetes de evidencia, revisa los campos obligatorios, las ejecuciones, las marcas de tiempo, las puntuaciones y las comprobaciones de seguridad de secretos. En los informes de comparación, revisa los nombres de los candidatos, el conjunto de tareas, el estado de borrador o finalizado, los casos únicos y si el resumen coincide con los veredictos registrados.
  4. 4Lee el resumen declarado y guarda la huella digital SHA-256 si necesitas confirmar más adelante que se está revisando exactamente el mismo archivo.
  5. 5Si una comprobación falla, corrige los datos de origen o completa los casos de comparación pendientes; no edites el informe descargado para forzar su aprobación.

Cómo interpretar el resultado

En Evidence v1/v2, Superado significa que el paquete cumple las reglas de estructura y coherencia admitidas, mientras que Demo identifica un ejemplo. En un informe de comparación, Superado significa que el informe finalizado es coherente internamente; Borrador significa que su estructura es válida, pero la comparación está incompleta. No superado significa que al menos una comprobación obligatoria debe revisarse.

Qué no puede demostrar

Una aprobación no demuestra que el modelo indicado produjera las respuestas pegadas, que las afirmaciones del proveedor sean ciertas ni que el resultado se generalice más allá de las pruebas registradas. Los resultados de archivos no relacionados no son comparables automáticamente.

Pregunta habitual: ¿Que un informe de comparación haya superado la validación demuestra que un modelo es mejor?

No. Solo confirma que el informe compatible es válido desde el punto de vista estructural y coherente internamente. Aún debes evaluar la identidad del modelo, la calidad de las pruebas, los resultados y su pertinencia para la decisión.

Volver arriba
15

Metodología de evaluación

Aprende qué hace que una decisión sobre modelos pueda inspeccionarse y reproducirse.

Abrir

Para qué sirve esta función

Usa esta página antes de diseñar, publicar o utilizar una evaluación. Distingue la calidad de la evidencia de la popularidad del modelo.

Antes de empezar

Empiece con una pregunta concreta para tomar una decisión, versiones de modelos identificadas, tareas representativas y un plan para conservar los resultados brutos.

Tutorial paso a paso

  1. 1Escribe la decisión y los criterios de éxito antes de ver los resultados.
  2. 2Usa el mismo conjunto de tareas, ajustes y reglas de puntuación para todos los candidatos.
  3. 3Conservar los prompts, resultados, ajustes, fallos, marcas de tiempo y huellas digitales de la batería de pruebas.
  4. 4Indique qué se hizo manualmente, qué se automatizó, qué se revisó con las etiquetas de los modelos ocultas, qué se aleatorizó o qué se reprodujo de forma independiente.
  5. 5Publica las conclusiones junto con la incertidumbre y las limitaciones explícitas.

Cómo interpretar el resultado

Evidence v1/v2 comprueba principalmente el formato y las declaraciones. espacio de decisiones V3 permite el recálculo local (L3); la reproducción independiente L4 aún no está disponible.

Qué no puede demostrar

Un proceso riguroso puede reducir el sesgo, pero no garantiza que una muestra represente a todos los usuarios, idiomas, versiones futuras o condiciones de producción.

Pregunta habitual: ¿Siempre es necesario un nivel de evidencia más alto?

Adapta el rigor a las consecuencias. Para una prueba personal puede bastar L1; una afirmación pública o de alto riesgo debería buscar evidencia independiente más sólida.

Volver arriba

Glosario en lenguaje claro

Usa estas definiciones cuando no conozcas alguna etiqueta.

Registro de la fuente
Una fila conservada de una clasificación publicada, con el ID o nombre de modelo de la fuente mantenido exactamente para revisión y auditoría.
ID oficial del modelo
Un identificador de modelo documentado por el proveedor que OpenGPT mantiene separado del nombre del registro de origen.
Versión del catálogo
Una versión de modelo incluida a partir de la documentación del proveedor, con su destino oficial y su fuente de revisión.
Intervalo probable de puntuación
Un intervalo de incertidumbre publicado alrededor de la puntuación mostrada. Los intervalos más amplios indican menos precisión; los intervalos de distintas fuentes de clasificación no son directamente comparables.
Mis modelos
Una lista de preselección almacenada solo en este navegador. No es una cuenta, sincronización en la nube ni marcador del proveedor.
Adecuación al requisito
Una etiqueta cualitativa de adecuación de la familia, junto con el número de requisitos coincidentes; ninguna de las dos evalúa versiones individuales. Compruebe la disponibilidad y compare versiones exactas en las mismas tareas.
Familia de modelos
Un grupo de versiones de modelos relacionadas. Las capacidades, los precios y el acceso pueden variar entre versiones.
Benchmark
Un conjunto de tareas y una regla de puntuación repetibles que se utilizan para comparar sistemas en condiciones declaradas.
Configuración de Agent
El modelo base, el andamiaje, las herramientas, los permisos, el presupuesto, el entorno, la versión del benchmark y la fecha que produjeron un resultado de Agent.
Calidad de la evidencia
Una etiqueta que describe cómo se produjo o comprobó un resultado. No modifica la puntuación de origen.
Coste por éxito
Coste de evaluación comunicado dividido entre las tareas completadas. Solo se muestra cuando existen datos comparables de la fuente; que falte el coste no significa que sea cero.
Archivo de evidencia
Un registro estructurado que declara cómo se realizó una evaluación y qué observó.
Esquema
Las reglas legibles por máquina que definen los campos obligatorios y los valores permitidos en un archivo.
Huella SHA-256
Un identificador local para los bytes exactos de un archivo; si el archivo cambia, también cambia la huella.

Solución de problemas

Ningún modelo cumple todos los requisitos

Revise qué requisito excluyó a cada candidato y flexibilice solo una restricción que sea realmente flexible.

Revisar requisitos

Se omite un número de posición de la fuente

El editor puede utilizar posiciones empatadas o varias configuraciones. OpenGPT conserva la posición original en lugar de renumerar las filas visibles.

Revisar la clasificación

A un resultado de Agent le faltan datos de coste o fiabilidad

La fuente no publicó un valor comparable. OpenGPT lo deja sin informar en lugar de tratarlo como cero; compare únicamente valores del mismo alcance de benchmark.

Revisar evidencia de Agent

Una fila no tiene un ID oficial de modelo

Es un registro completo de la fuente, no un estado sin resolver. Abre la fuente original; utiliza el directorio de modelos cuando necesites una identidad documentada por el proveedor y acceso oficial.

Revisar identidad de la fuente

«Mis modelos» está vacío o ha desaparecido

Usa el mismo perfil del navegador y el mismo dispositivo. El modo privado, el almacenamiento bloqueado o el borrado de los datos del sitio pueden eliminar la lista local.

Abrir Mis modelos

No se puede añadir un registro a la comparación de datos

La comparación de datos acepta identificadores de modelos del catálogo. Es posible que el mismo modelo ya esté seleccionado o que la lista haya alcanzado su límite de cuatro modelos. Elige otra versión del catálogo o elimina primero un candidato.

Abrir el directorio de modelos

La prueba de Proof Lab está incompleta

Vuelva a la prueba y complete todos los resultados requeridos de configuración y tarea, el estado de revisión, la comprobación de fallos críticos y el resultado confirmado por el usuario.

Continuar en Proof Lab

Un borrador local entra en conflicto o necesita restablecerse

Vuelva a Comparar, revise la advertencia sobre el borrador local más reciente y, a continuación, conserve o restablezca el borrador de forma deliberada.

Revisar borrador local

Falla un archivo de evidencia

Usa el elemento fallido de la lista de comprobación para corregir el registro de la fuente. No introduzcas secretos ni reescribas resultados.

Abrir el verificador
contact@opengpt.com

¿Aún necesita ayuda?

Informa de un enlace roto, un dato incorrecto del modelo o un problema que no hayas podido resolver.

Soporte por correo electrónico