Apple a lancé LensVLM-9B, un Modèle de Langage Visuel de 9 milliards de paramètres conçu pour traiter plus efficacement des images de texte compressées. Le modèle scanne ces entrées compressées et utilise des outils appris pour étendre sélectivement uniquement les pages pertinentes à leur forme non compressée.

Le lancement inclut les poids du modèle sous la licence Apple Machine Learning Research Model License et le code source sous la licence Apple Sample Code License. Il est construit sur des modifications de l'architecture Qwen et est accompagné d'un article intitulé "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" disponible sur arXiv.

Cette approche permet au modèle de gérer les représentations visuelles du texte en concentrant les ressources informatiques uniquement sur les détails nécessaires, améliorant potentiellement l'efficacité dans le traitement de grands documents.