Apple ha lanzado LensVLM-9B, un Modelo de Lenguaje Visual de 9 mil millones de parámetros diseñado para procesar imágenes comprimidas de texto de manera más eficiente. El modelo escanea estas entradas comprimidas y utiliza herramientas aprendidas para expandir selectivamente solo las páginas relevantes a su forma sin comprimir.
El lanzamiento incluye los pesos del modelo bajo la Licencia de Investigación de Aprendizaje Automático de Apple y el código fuente bajo la Licencia de Código de Muestra de Apple. Está construido sobre modificaciones de la arquitectura Qwen y viene acompañado de un artículo titulado "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" disponible en arXiv.
Este enfoque permite al modelo manejar representaciones visuales de texto enfocando los recursos computacionales solo en los detalles necesarios, mejorando potencialmente la eficiencia en el procesamiento de documentos grandes.