Vea cómo una recomendación se convierte en una decisión.
OpenGPT es un espacio de decisiones sobre IA. Mantiene separados la correspondencia editorial de requisitos, los registros de fuentes fácticos, la evaluación con tareas reales y las pruebas de referencia publicadas, de modo que cada resultado pueda mostrar sus condiciones y limitaciones.
El método en un minuto
- Una posición es relativa a una fuente y un alcance concretos, no una puntuación universal.
- Las unidades de comparación son las versiones exactas de los modelos y las configuraciones completas de los agentes.
- Los datos desconocidos o incompatibles siguen siendo desconocidos en lugar de convertirse en cero o en una clasificación combinada.
- Las comprobaciones locales del informe demuestran la estructura y la coherencia interna, no el origen de la salida ni la autenticidad del proveedor.
Puntuaciones de adecuación editorial · editorial-fit-v1
Cómo se asignan las puntuaciones editoriales de adecuación de 0 a 10
Estas ocho señales de catálogo permiten comparar categoría por categoría. Constituyen una capa documentada de criterio editorial de OpenGPT, independiente de los puntos de recomendación de rules-v2 y de las evidencias de benchmarks públicos.
Puntuación editorial de adecuación del producto: 10 indica una mayor adecuación a la dimensión indicada; todas las dimensiones se muestran por igual y nunca se combinan para declarar un ganador general.
Inteligencia
0–10Adecuación editorial para trabajos generales amplios y complejos según las capacidades documentadas, la función en el catálogo y las restricciones conocidas del producto; no es una puntuación de inteligencia ni de benchmark.
Programación
0–10Adecuación editorial para la planificación, implementación, depuración y revisión de software y los flujos de repositorios; no es una tasa de aprobación medida.
Razonamiento
0–10Adecuación editorial para análisis con varios pasos, gestión de restricciones y resolución estructurada de problemas; no reproduce ningún benchmark de razonamiento.
Redacción
0–10Adecuación editorial para flujos de redacción, edición, textos extensos y documentación; no es un resultado medido de estilo ni veracidad.
Velocidad
0–10Adecuación editorial para iteraciones ágiles según el posicionamiento del producto y el modo de entrega; no es una medición de latencia.
Eficiencia de costes
0–10Adecuación editorial para controlar el precio de acceso y el coste operativo según los niveles y el modo de despliegue indicados; no es un cálculo del coste total ni una garantía de precios.
Control de la privacidad
0–10Adecuación editorial del despliegue y el control de datos según su clasificación local, híbrida o en la nube; no es una auditoría de seguridad, cumplimiento ni telemetría.
Ecosistema
0–10Adecuación editorial de las herramientas, integraciones, plataformas y opciones de despliegue disponibles; no mide la cuota de mercado ni la calidad de las integraciones.
Ponderaciones y agregación
Cada dimensión recibe la misma prominencia visual. No hay ponderación aritmética, promedio, puntuación total ni ganador general; el usuario decide qué dimensiones importan para las condiciones indicadas.
Límite del criterio humano editorial
Los editores asignan señales enteras de adecuación de 0 a 10 a partir de la rúbrica, los datos del producto confirmados por el proveedor y las clasificaciones del catálogo. Una puntuación no es una medición de una versión exacta, un resultado de benchmark, una probabilidad ni una garantía del proveedor.
Fuentes
Las páginas oficiales del proveedor respaldan la identidad, el acceso, las capacidades publicadas, las opciones de implementación y los precios indicados. Las etiquetas «mejor para», las fortalezas, las debilidades, las clasificaciones y todos los valores de 0 a 10 de OpenGPT son aportaciones editoriales.
Revisión del catálogo
Última revisión del catálogo:
Confianza: Cobertura editorial media
La confianza describe la integridad de la cobertura del catálogo y de la explicación, no la probabilidad de obtener un buen rendimiento. Los datos del proveedor pueden cambiar y la señal de adecuación no se ha medido de forma independiente.
Aplicabilidad
Usa las puntuaciones para comparar entradas del catálogo según la dimensión indicada y los supuestos actuales sobre el producto y el despliegue. No interpretes las diferencias de puntuación como diferencias de rendimiento medidas.
Antes de adoptarlo, verifica la información actual del proveedor y prueba la versión exacta del modelo, el nivel de servicio, las herramientas, la región y una muestra de trabajo representativa.
Método publicado · rules-v2
Cómo se elaboran las recomendaciones de OpenGPT
El Generador convierte un Perfil local en una selección preliminar determinista. Los puntos que aparecen a continuación ordenan la adecuación editorial del producto después de aplicar filtros estrictos de presupuesto y privacidad; no miden la calidad del modelo.
Dimensiones de puntuación y puntos acumulativos de las reglas
Los puntos son ponderaciones condicionales, no porcentajes. Un requisito obligatorio elimina un elemento no válido antes de puntuarlo.
Adecuación a la tarea y al objetivo
Model · ToolLos modelos reciben +12 por cada coincidencia con una tarea seleccionada y +10 por una coincidencia exacta con el objetivo. Las herramientas reciben +10 por cada coincidencia con un caso de uso seleccionado.
User-declared conditions · OpenGPT editorial catalogPrivacidad e implementación
Model · ToolLa privacidad alta excluye los modelos no locales y las herramientas que no estén clasificadas como de privacidad alta. Los modelos locales aptos suman 30 puntos y las herramientas de privacidad alta, 12. Con privacidad media, los modelos híbridos/locales/en la nube suman 8/5/2 puntos.
User-declared conditions · OpenGPT editorial catalogCumplimiento del presupuesto
Model · ToolSe excluyen los elementos que quedan fuera del intervalo de precios de catálogo seleccionado. Los modelos aptos suman 12 puntos y las herramientas, 8; un modelo apto para el perfil gratuito que ofrezca una opción inicial gratuita anunciada suma otros 16 puntos.
User-declared conditions · Provider-published facts · OpenGPT editorial catalogIdoneidad para la función profesional
Model · ToolLas coincidencias entre estudiantes y modelos reciben +10; las demás coincidencias compatibles entre modelo y función, +8. Las coincidencias entre estudiantes y herramientas reciben +8; las demás coincidencias compatibles entre herramienta y función, +6.
User-declared conditions · OpenGPT editorial catalogSeñales del sector
Model · ToolLos términos reconocidos del sector se asignan a categorías de tareas. Los modelos reciben +5 y las herramientas +4 por cada coincidencia de tarea asignada. El texto libre no se copia en el flujo de trabajo.
User-declared conditions · OpenGPT editorial catalogAdecuación lingüística
ModeloCon una preferencia distinta del inglés, una coincidencia con un catálogo multilingüe suma 14 puntos y una falta de coincidencia resta 3. Para el inglés, la adecuación a la redacción o la documentación suma 3 puntos.
User-declared conditions · OpenGPT editorial catalogCompatibilidad con la plataforma
Model · ToolLas coincidencias de modelos puntúan Web +3, Escritorio +10, Terminal +8, API +7 y Móvil +9. Las herramientas reciben +7 por cada coincidencia de plataforma o −3 si no coincide ninguna.
User-declared conditions · OpenGPT editorial catalogAdecuación a la experiencia
Model · ToolLa idoneidad del modelo para principiantes suma 10 (o resta 4 si un modelo local no encaja), la idoneidad avanzada suma 7 y la idoneidad intermedia para modelos de frontera o híbridos suma 2. La idoneidad de las herramientas para principiantes o usuarios avanzados suma 6 o 5, respectivamente.
User-declared conditions · OpenGPT editorial catalogSelección y empates
Model · ToolLos candidatos aptos se ordenan por puntos de las reglas; si hay empate, se usa el orden alfabético. Las funciones se asignan en una secuencia fija y hasta tres modelos restantes que cumplan los requisitos pasan a ser alternativas.
Reglas deterministas v2Fuentes y límites de las afirmaciones
Datos publicados por el proveedor
Las páginas oficiales del proveedor respaldan la identidad, el acceso, las descripciones de capacidades publicadas y los precios indicados. OpenGPT no considera esas páginas pruebas independientes de rendimiento.
Catálogo editorial de OpenGPT
Las etiquetas «Ideal para», las fortalezas, las clasificaciones de privacidad y despliegue y las señales de idoneidad del producto son valoraciones editoriales revisadas. No son mediciones de benchmarks ni garantías de los proveedores.
Condiciones declaradas por el usuario
El objetivo, las tareas, el rol, el presupuesto, la privacidad, el idioma, la plataforma, el nivel y las señales del sector proceden del perfil local del usuario. Describen su aplicabilidad, no evidencia externa.
Reglas deterministas v2
El mismo perfil normalizado y la misma instantánea del catálogo producen el mismo orden. La aritmética se puede explicar, pero el determinismo no convierte las aportaciones editoriales en hechos.
Contexto de pruebas de referencia públicas
Las clasificaciones públicas se mantienen como pruebas independientes. rules-v2 no suma posiciones ni puntuaciones de pruebas de referencia a los puntos de recomendación; úsalas después de elaborar la lista de finalistas y conserva el alcance de cada fuente.
Datos frente a criterio editorial
Las afirmaciones factuales deben remitir a un proveedor o una fuente de benchmark con nombre, a una identidad exacta cuando esté disponible y a una fecha de revisión.
Las etiquetas de adecuación, fortalezas, clasificaciones, supuestos, niveles de confianza y recomendaciones son criterios editoriales de OpenGPT. No deben presentarse como resultados medidos de una versión exacta.
Revisar la frecuencia y la confianza
La metodología y los registros de recomendaciones activas tienen programada una revisión al menos cada 90 días, además de revisiones motivadas por eventos. Cada resultado debe usar la fecha de revisión de su propio registro, no la fecha de esta página.
La revisión se activa cuando
- Un proveedor cambia el ID de un modelo, su ciclo de vida, la ruta de acceso, una declaración de capacidad o el precio indicado.
- Cambia el motor de recomendaciones, las ponderaciones, los filtros estrictos o la taxonomía editorial.
- Una corrección identifica un error sustancial de fuente, identidad, precio, privacidad o aplicabilidad.
Reglas de confianza
La confianza describe la integridad de la explicación de adecuación y del registro que la respalda. No expresa la probabilidad de que el modelo funcione bien.
- Alto
- Se dispone de la identidad exacta y de una fuente factual vigente; los campos importantes están resueltos, los supuestos son visibles y se indica una alternativa válida.
- Medio
- La coincidencia se puede explicar, pero es necesario confirmar una fuente, una condición o un dato actual antes de adoptarla.
- Bajo
- Existe una carencia importante en la identidad, la vigencia, el precio, la privacidad o la aplicabilidad. Considera el elemento únicamente como un candidato que debe investigarse.
Aplicabilidad y condiciones
- Se aplica a la preselección editorial rules-v2 generada a partir del catálogo actual revisado de modelos y herramientas.
- El resultado depende del perfil enviado y de la instantánea del catálogo; si cambia cualquiera de los dos, el resultado puede cambiar.
- Es una ayuda para decisiones de bajo riesgo, no una prueba de calidad, precio vigente, liderazgo en benchmarks, seguridad, legalidad ni idoneidad para un uso regulado.
Visualización de auditoría obligatoria para cada resultado
Una recomendación integrada debe mostrar los siete campos siguientes sin obligar al usuario a deducir el límite de la evidencia.
- Por qué
- Evidencia
- Supuestos
- Última revisión
- Confianza
- Mejor alternativa
- Cuándo no elegirlo
De una tarea real a una conclusión revisable
Definir la prueba
Antes de comparar, registra la tarea, los criterios de éxito, las entradas, las restricciones, las versiones exactas de los modelos, los ajustes y la fecha.
Usa las mismas condiciones
Asigna la misma tarea y rúbrica a cada candidato. Ocultar las etiquetas reduce el sesgo por el nombre visible, pero no convierte la prueba en un estudio de doble ciego ni en una evaluación independiente.
Conservar los datos de la fuente
Guarde solicitudes, respuestas, puntuaciones, errores, latencia y hashes. No complete las evidencias que falten con estimaciones.
Indique los límites
Muestre la incertidumbre, el tamaño de la muestra, las exclusiones, los conflictos y aquello que el resultado no demuestra.
Niveles de evidencia
Evidence v1/v2 comprueba el formato del archivo y la coherencia declarada. espacio de decisiones V3 también vuelve a calcular los hashes, las asignaciones, las correspondencias, las puntuaciones y los resúmenes a partir de los datos guardados. No demuestra una reproducción independiente de nivel L4.
Formato comprobado
El archivo sigue el esquema declarado y no contiene campos secretos evidentes.
Registro completo
El objetivo es obtener un registro coherente de tareas, ajustes, declaraciones de modelos y fecha de evaluación. V1 solo comprueba una parte de este registro.
Recalculable
espacio de decisiones V3 incluye los resultados completos pegados y las entradas de puntuación para volver a calcularlos estrictamente en local; Evidence v1/v2 no contiene los mismos campos.
Reproducido de forma independiente
Target: a separate runner or signed source reproduces the result under comparable conditions. V1 does not verify this.
Cómo se comparan las clasificaciones de agentes de IA
Cada fila representa una configuración de agente publicada dentro de un benchmark identificado. No es una puntuación exclusiva del modelo base.
Comparar configuraciones completas del sistema
Mantén juntos todos los campos de agente, modelo base, andamiaje, herramienta, entorno, presupuesto y fecha publicados por la fuente; marca como desconocidos los campos no publicados.
Conservar las escalas originales
Clasifica únicamente dentro de la misma prueba de referencia, versión, reglas de tareas y grupo de ejecuciones comparables. OpenGPT no crea una puntuación universal entre pruebas de referencia.
Indica el estado de las pruebas
Distingue los registros incluidos por el editor de un benchmark, los envíos comprobados en origen, los informes de proveedores y las ejecuciones de la comunidad.
Conservar la evidencia operativa
Muestre el coste, la latencia, los pasos y la intervención humana cuando la fuente proporcione valores comparables; deje como desconocidos los valores ausentes.
Qué puede establecer la validación local
- ✓Campos obligatorios y tipos de datos compatibles
- ✓Coherencia interna de las puntuaciones, ejecuciones, fechas y hashes
- ✓Si el paquete declara datos de demostración
- ✓Ausencia de campos habituales de claves de API y secretos
Qué no puede establecer por sí solo
- —Que el proveedor o modelo declarado haya producido realmente el resultado
- —Que una puntuación esté libre de sesgo de selección o de un diseño de prueba deficiente
- —Que un resultado se aplique a todas las tareas, idiomas, usuarios o versiones futuras de modelos
- —Que un modelo sea seguro, legal o adecuado para una decisión de alto riesgo
Principios de publicación
No se paga por aparecer en la clasificación
El patrocinio puede declararse, pero no puede cambiar la puntuación, los criterios de evidencia ni la ubicación.
Versiones, no marcas
Una serie de modelos no es un objeto de prueba estable. Importan los IDs exactos de los modelos, la configuración, la región y la fecha.
Tareas reales antes de hacer afirmaciones generales
OpenGPT recomienda listas de finalistas según los requisitos y después pide a los usuarios que prueben su propio trabajo representativo.
La incertidumbre también es un resultado
Los empates, las muestras pequeñas, las ejecuciones fallidas y la evidencia no concluyente deben permanecer visibles.