A Apple lançou o LensVLM-9B, um Modelo de Linguagem Visual com 9 bilhões de parâmetros projetado para processar imagens de texto comprimidas de forma mais eficiente. O modelo escaneia essas entradas comprimidas e usa ferramentas aprendidas para expandir seletivamente apenas as páginas relevantes para sua forma não comprimida.
O lançamento inclui os pesos do modelo sob a Apple Machine Learning Research Model License e o código-fonte sob a Apple Sample Code License. Ele é construído com base em modificações da arquitetura Qwen e é acompanhado por um artigo intitulado "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" disponível no arXiv.
Essa abordagem permite que o modelo lide com representações visuais de texto, concentrando recursos computacionais apenas nos detalhes necessários, potencialmente melhorando a eficiência no processamento de documentos grandes.