Trabajo con imágenes y contenido multimodal
Imágenes, documentos, extracción y razonamiento combinado sobre texto e imágenes.
- Por qué estos candidatos
- Assumption · Historical. Incluye opciones multimodales gestionadas y abiertas; después, prueba los tipos de imagen, la resolución y el formato de salida exactos que utilizas.
- Qué sigue siendo incierto
- La señal actual basada en tareas objetivas no es un benchmark específico de visión y algunos candidatos carecen de datos comparables.
Tres versiones oficiales que probar primero
Los datos públicos acotan las opciones, pero no sustituyen una prueba controlada con tu propio trabajo. Seleccione dos o tres candidatos para comparar en paralelo los datos públicos.
Unknown · Not automatically certified
Actualmente no hay ningún resultado público comparable asociado a esta versión exacta.
Evidencia públicaLos modelos utilizan distintas escalas de evidencias públicas. Las evidencias ausentes no se tratan como cero y OpenGPT no combina fuentes diferentes en una sola puntuación.+
Un punto de partida práctico, no un ganador universalSeleccione dos o tres candidatos para comparar en paralelo los datos públicos.+
Los modelos utilizan distintas escalas de evidencias públicas. Las evidencias ausentes no se tratan como cero y OpenGPT no combina fuentes diferentes en una sola puntuación.
La señal actual basada en tareas objetivas no es un benchmark específico de visión y algunos candidatos carecen de datos comparables.
La evaluación se abre con esta plantilla de tareas y los dos primeros modelos seleccionados. Puede editar todas las tareas antes de recopilar respuestas.