Ningún modelo cumple todos los requisitos
Revise qué requisito excluyó a cada candidato y flexibilice solo una restricción que sea realmente flexible.
Revisar requisitosEncuentra el flujo de trabajo adecuado, sigue cada paso y entiende qué puede demostrar el resultado y qué no.
Cada flujo de trabajo responde a una pregunta distinta. Empieza por el objetivo más cercano y sigue después la guía enlazada.
Vea qué se clasifica, de dónde proceden los datos y qué registros incluyen un ID oficial de modelo.
Usa cada enfoque de clasificación para examinar las señales publicadas, revisar los registros de las fuentes y crear una lista de preselección para realizar pruebas con tareas reales.
Empiece con la pregunta que necesita responder. Las preferencias de los usuarios, la capacidad general, las tareas objetivas, el coste y las clasificaciones de pesos abiertos utilizan fuentes y escalas diferentes.
Una posición es relativa a una fuente y un alcance. Los empates pueden hacer que se omitan números de posición y las puntuaciones de distintos enfoques de clasificación no son directamente comparables.
OpenGPT organiza datos públicos de terceros y no ha repetido estas evaluaciones. Ninguna clasificación identifica el mejor modelo para todos los usuarios o tareas.
Ahora cada fila incluye los detalles del modelo y una acción de comparación. OpenGPT solo añade un ID oficial de modelo cuando la documentación del proveedor demuestra la correspondencia exacta; de lo contrario, la comparación del registro de origen conserva el nombre, la configuración y los datos de clasificación publicados, sin inventar un nuevo ID oficial.
Elige un Agent según la tarea, la configuración completa, la calidad de la evidencia y los resultados comparables.
Explora 96 configuraciones publicadas de evaluación de agentes en siete ámbitos de tareas, además de 109 resultados independientes BFCL de modelos en uso de herramientas, sin convertir evidencias incompatibles en una única puntuación.
El resultado de un agente pertenece a una configuración completa: modelo base, scaffold, herramientas, permisos, presupuesto, entorno, versión del benchmark y fecha. OpenGPT conserva los campos comunicados por la fuente y deja sin informar los que faltan; no los considera cero.
Una posición describe una configuración completa del sistema dentro del alcance de un benchmark. Interprétela junto con el grado de evidencia, la actualidad, el número de muestras o ejecuciones y los campos de coste y fiabilidad indicados.
OpenGPT no crea una puntuación universal de agentes. Salvo que un resultado se marque expresamente como reproducido, OpenGPT organiza pruebas de terceros en lugar de repetirlas; ninguna prueba de referencia demuestra que un sistema esté listo para producción en todos los flujos de trabajo.
Un scaffold, una versión de modelo, un conjunto de herramientas, un nivel de permisos, un presupuesto o una configuración de benchmark diferentes crean una configuración de agente distinta y deben conservarse como un registro separado.
Envíe un registro público de identidad o evidencia para revisión sin modificar las clasificaciones.
Usa el flujo de envío cuando falte un ID oficial de modelo o un producto Agent, o cuando una fuente pública necesite revisión editorial.
Inicie sesión con una cuenta verificada y prepare una fuente HTTPS pública. Nunca envíe credenciales, archivos privados ni información personal.
Una entrega correcta recibe un número de referencia y entra en la cola de revisión. Un producto Agent aprobado es un registro del directorio público, no una posición en la clasificación ni una recomendación de OpenGPT.
Los remitentes no pueden establecer la posición, el grado de evidencia, la comparabilidad ni el estado de publicación. Los límites de duplicados y frecuencia reducen los abusos, y la aprobación nunca modifica automáticamente una clasificación.
Los productos Agent aprobados se pueden buscar en el directorio, pero para clasificarlos sigue siendo necesario disponer de evidencia pública de evaluación comparable.
Sigue la evolución entre instantáneas comparables y compara los ID de modelos del catálogo.
Usa esta página para ver qué ha cambiado desde la instantánea anterior de la fuente, qué registros han aparecido por primera vez, en qué difieren las versiones exactas y cuándo se consultaron los datos.
El movimiento histórico utiliza actualmente el ámbito de preferencias de usuarios de LMArena. Las demás fuentes activas solo muestran el estado vigente hasta que exista una instantánea anterior comparable.
OpenGPT solo calcula el movimiento cuando coinciden la fuente, el alcance, la unidad y el método, y conserva instantáneas mensuales descargables.
Solo se consideran lanzamientos de producto las fechas de lanzamiento documentadas por el proveedor. La comparación de versiones no deduce la velocidad, el precio, la longitud del contexto ni la calidad a partir de los nombres.
OpenGPT no ha fijado una edición anterior comparable para esta fuente activa. Las fuentes en pausa se conservan como históricas y no contribuyen al movimiento actual.
Parta de un escenario de trabajo real y revise tres versiones oficiales de modelos que convenga probar primero.
Usa las clasificaciones por tareas para convertir señales públicas amplias en una lista de preselección pequeña y práctica para programación, investigación, documentos, soporte, trabajo multilingüe, trabajo multimodal, coste, privacidad o velocidad.
Elige la tarea más parecida a tu trabajo y anota después tus prompts, datos, herramientas, región, presupuesto y requisitos de privacidad reales. La evidencia pública mostrada puede abarcar un ámbito más amplio que tu tarea.
Obtienes tres candidatos oficiales iniciales, evidencia pública visible cuando está disponible y rutas directas para comparar o ejecutar una prueba con tareas reales.
Una clasificación por tarea es una preselección inicial, no una clasificación universal ni una prueba del mejor modelo. La ausencia de evidencia no equivale a cero y las fuentes públicas diferentes no se combinan en una sola puntuación.
Una versión oficial puede ser pertinente para la tarea por el posicionamiento del producto o el tipo de implementación, incluso cuando no se haya asignado ningún resultado de esa versión exacta en la fuente pública seleccionada. La falta de evidencia permanece visible y debe resolverse mediante una prueba propia.
Defina los modelos que utiliza, el trabajo recurrente y las prioridades; después, revise señales prudentes para saber cuándo merece la pena realizar una comparación justa.
Usa el Radar para responder a una pregunta práctica: ¿existe evidencia pública comparable suficiente para probar una alternativa al modelo que utilizas actualmente?
Elige versiones oficiales exactas, al menos una tarea recurrente y hasta dos prioridades. Usa el mismo navegador y dispositivo, ya que la configuración permanece en local.
El Radar crea una comprobación de actualizaciones local en el dispositivo con un modelo actual, una alternativa adaptada a la tarea cuando está disponible, fecha de las evidencias, límites de incertidumbre y acciones de comparación directa.
Una comprobación de actualización no es una instrucción para cambiar. El coste, la velocidad, la privacidad o el contexto aún pueden requerir pruebas directas, y la configuración local no se sincroniza ni se incluye en copias de seguridad.
No. Significa que una señal comparable o un cambio en el ciclo de vida justifican repetir la prueba con la misma tarea. Cambia solo después de que la alternativa funcione satisfactoriamente con tu trabajo y tus restricciones reales.
Convierte cuatro requisitos prácticos en una lista de preselección explicable.
Usa el buscador cuando sepas qué trabajo necesitas realizar, pero no qué serie de modelos investigar primero.
Identifica la tarea principal, dónde puede ejecutarse el modelo, cuál es tu prioridad operativa más importante y si existe algún requisito lingüístico.
La etiqueta cualitativa y el número de coincidencias con los requisitos corresponden a la serie de modelos, no a versiones individuales; ninguno de los dos es una puntuación de benchmark. Verifique la disponibilidad de implementación de cada versión actual incluida y compare a los candidatos con las mismas tareas.
El buscador no llama a modelos, verifica precios actuales ni designa un ganador universal. Una serie de modelos puede incluir versiones con distintas capacidades.
El orden refleja las restricciones que seleccionó, no la popularidad general. Cambie un requisito para ver qué causó el resultado y, después, pruebe versiones exactas.
Explora los ID de modelos documentados por los proveedores, abre páginas de detalles específicas y comprueba si existen datos públicos de clasificación comparables.
Usa el directorio cuando necesites un ID oficial exacto de modelo, un destino del proveedor, tareas adecuadas y no adecuadas, fuentes y un estado claro de los datos de clasificación.
Introduce el nombre de un modelo, un proveedor, una necesidad de despliegue o una tarea. Que el proveedor documente un ID de modelo no garantiza que existan datos públicos de evaluación comparables.
«Clasificado» significa que hay datos publicados comparables vinculados a ese ID exacto de modelo. «Sin clasificar» significa que esta edición no contiene un registro comparable adecuado; no equivale a una puntuación de cero.
La documentación del proveedor confirma la identidad del catálogo, pero no la disponibilidad actual en todos los países o niveles de servicio. La cobertura de las clasificaciones, los detalles de los modelos y las condiciones del proveedor pueden cambiar después de la fecha de revisión.
No. Significa que esta edición carece de datos públicos comparables adecuados para ese ID de modelo. Pruébalo directamente si sigue siendo pertinente para tu decisión.
Compara entre dos y cuatro versiones oficiales exactas o registros de una única vista de clasificación publicada.
La comparación de versiones oficiales organiza los IDs documentados por el proveedor entre las fuentes publicadas. La comparación de registros de fuente conserva el nombre y los ajustes del editor cuando una comparación oficial exacta haría que se perdiera información.
Para las versiones oficiales, elige entre dos y cuatro ID del catálogo. Para los registros de origen, elige entre dos y cuatro filas de la misma fuente, dimensión e instantánea.
La comparación crea una selección preliminar que tiene en cuenta las evidencias y muestra dónde falta información. No genera una nueva puntuación de benchmark ni declara un ganador universal.
OpenGPT no llama a los modelos en esta vista. Las puntuaciones publicadas de fuentes o alcances distintos no son intercambiables, y los detalles de los modelos pueden cambiar después de su fecha de revisión.
La comparación de datos resume información ya publicada sobre entre dos y cuatro modelos. La evaluación con tareas reales utiliza exactamente dos versiones, te pide ejecutar los mismos prompts en ambos servicios y revisa las respuestas pegadas ocultando las etiquetas visibles de los modelos.
Mantén una pequeña lista de trabajo con entradas de la clasificación en este navegador.
Usa Modelos guardados para volver rápidamente a los candidatos, abrir destinos de confianza e incorporar a una comparación los ID de modelos compatibles.
Usa el mismo navegador y dispositivo. La lista se almacena localmente, sin una cuenta de OpenGPT ni sincronización en la nube.
El recuento junto a Modelos guardados muestra cuántas entradas se han guardado. La identidad de la fuente y la identidad oficial del modelo permanecen separadas.
La lista no es una cuenta, una sincronización de marcadores ni una copia de seguridad. Otro navegador o dispositivo no la verá, y la navegación privada, las restricciones de almacenamiento o el borrado de los datos del sitio pueden eliminarla.
Comprueba que estás usando el mismo perfil del navegador y el mismo dispositivo. Si el almacenamiento del sitio se borró o bloqueó, OpenGPT no puede restaurar la lista local.
Ejecute una prueba privada con trabajo real; el modo temporal conserva los resultados brutos en la memoria, salvo que decida guardarlos en este dispositivo.
Compara entre 2 y 4 configuraciones exactas de modelos o Agents con un único Paquete de tareas controlado y auditable.
Registra cada configuración exacta, abre los servicios correspondientes del proveedor, elimina los datos sensibles y recuerda que sus políticas se aplican a todo lo que envíes allí.
El resultado es un desenlace confirmado por el usuario, vinculado al paquete de tareas congelado y a las configuraciones registradas. De forma predeterminada, solo se exportan metadatos; exportar todos los datos brutos requiere consentimiento explícito y puede comprobarse con el verificador local.
Ocultar las etiquetas reduce el sesgo por el nombre visible, pero no constituye una prueba de doble ciego. OpenGPT no ejecuta los servicios de los proveedores ni demuestra el origen de la salida, la exactitud de la configuración, su integridad, la privacidad de los proveedores externos o la generalización más allá de estas tareas. Los resultados de pruebas privadas son Probado con tu trabajo, no Evidencia pública.
La prueba se ejecuta en su navegador. El modo temporal conserva los resultados brutos en la memoria; guardarlos en este dispositivo es opcional. La exportación de metadatos excluye los resultados brutos y su exportación completa requiere consentimiento explícito.
Reutilice las mismas solicitudes reales en una evaluación de modelos posterior sin reconstruir el conjunto de tareas.
Usa conjuntos de tareas guardados para que las comparaciones futuras sean más coherentes y para volver a evaluar versiones exactas de modelos tras un lanzamiento o un cambio en los datos públicos.
Completa los títulos y las instrucciones de las tareas, elige un nombre claro para el conjunto y utiliza el mismo navegador y dispositivo. Un conjunto de tareas puede contener texto de trabajo confidencial; elimina los datos privados antes de guardarlo.
El nombre del conjunto de tareas, la plantilla, el idioma, los títulos de tareas y las solicitudes se almacenan localmente para reutilizarlos. La reevaluación inicia una ejecución limpia, pero conserva las entradas de prueba previstas.
Los conjuntos de tareas guardados existen únicamente en este dispositivo y no se sincronizan ni se incluyen en copias de seguridad. Las respuestas, las selecciones de modelos, las revisiones, los informes y las claves de API no se guardan en un conjunto de tareas. Si borra los datos del sitio, puede perder todos los conjuntos guardados.
OpenGPT conserva las mismas tareas y versiones exactas de los modelos, y luego borra las respuestas, puntuaciones, valoraciones, estado de revelación e informe anteriores para que la nueva ejecución sea independiente del resultado previo.
Comprueba la estructura, la coherencia interna, los patrones de secretos y la huella local de los informes JSON compatibles.
Usa el verificador para examinar un paquete OpenGPT Evidence v1 o v2, o un informe V3 descargado de espacio de decisiones. Todas las comprobaciones se ejecutan localmente en este navegador.
Obtén el archivo JSON original. Para un informe de comparación, descárgalo desde el Espacio de decisiones; si necesitas un resultado completo en lugar de un borrador, termina antes todos los casos.
En Evidence v1/v2, Superado significa que el paquete cumple las reglas de estructura y coherencia admitidas, mientras que Demo identifica un ejemplo. En un informe de comparación, Superado significa que el informe finalizado es coherente internamente; Borrador significa que su estructura es válida, pero la comparación está incompleta. No superado significa que al menos una comprobación obligatoria debe revisarse.
Una aprobación no demuestra que el modelo indicado produjera las respuestas pegadas, que las afirmaciones del proveedor sean ciertas ni que el resultado se generalice más allá de las pruebas registradas. Los resultados de archivos no relacionados no son comparables automáticamente.
No. Solo confirma que el informe compatible es válido desde el punto de vista estructural y coherente internamente. Aún debes evaluar la identidad del modelo, la calidad de las pruebas, los resultados y su pertinencia para la decisión.
Aprende qué hace que una decisión sobre modelos pueda inspeccionarse y reproducirse.
Usa esta página antes de diseñar, publicar o utilizar una evaluación. Distingue la calidad de la evidencia de la popularidad del modelo.
Empiece con una pregunta concreta para tomar una decisión, versiones de modelos identificadas, tareas representativas y un plan para conservar los resultados brutos.
Evidence v1/v2 comprueba principalmente el formato y las declaraciones. espacio de decisiones V3 permite el recálculo local (L3); la reproducción independiente L4 aún no está disponible.
Un proceso riguroso puede reducir el sesgo, pero no garantiza que una muestra represente a todos los usuarios, idiomas, versiones futuras o condiciones de producción.
Adapta el rigor a las consecuencias. Para una prueba personal puede bastar L1; una afirmación pública o de alto riesgo debería buscar evidencia independiente más sólida.
Usa estas definiciones cuando no conozcas alguna etiqueta.
Revise qué requisito excluyó a cada candidato y flexibilice solo una restricción que sea realmente flexible.
Revisar requisitosEl editor puede utilizar posiciones empatadas o varias configuraciones. OpenGPT conserva la posición original en lugar de renumerar las filas visibles.
Revisar la clasificaciónLa fuente no publicó un valor comparable. OpenGPT lo deja sin informar en lugar de tratarlo como cero; compare únicamente valores del mismo alcance de benchmark.
Revisar evidencia de AgentEs un registro completo de la fuente, no un estado sin resolver. Abre la fuente original; utiliza el directorio de modelos cuando necesites una identidad documentada por el proveedor y acceso oficial.
Revisar identidad de la fuenteUsa el mismo perfil del navegador y el mismo dispositivo. El modo privado, el almacenamiento bloqueado o el borrado de los datos del sitio pueden eliminar la lista local.
Abrir Mis modelosLa comparación de datos acepta identificadores de modelos del catálogo. Es posible que el mismo modelo ya esté seleccionado o que la lista haya alcanzado su límite de cuatro modelos. Elige otra versión del catálogo o elimina primero un candidato.
Abrir el directorio de modelosVuelva a la prueba y complete todos los resultados requeridos de configuración y tarea, el estado de revisión, la comprobación de fallos críticos y el resultado confirmado por el usuario.
Continuar en Proof LabVuelva a Comparar, revise la advertencia sobre el borrador local más reciente y, a continuación, conserve o restablezca el borrador de forma deliberada.
Revisar borrador localUsa el elemento fallido de la lista de comprobación para corregir el registro de la fuente. No introduzcas secretos ni reescribas resultados.
Abrir el verificadorInforma de un enlace roto, un dato incorrecto del modelo o un problema que no hayas podido resolver.