أطلقت أبل LensVLM-9B، وهو نموذج لغة مرئي يحتوي على 9 مليارات معلمة مصمم لمعالجة صور النص المضغوطة بكفاءة أكبر. يقوم النموذج بمسح هذه المدخلات المضغوطة ويستخدم أدوات تم تعلمها لتوسيع الصفحات ذات الصلة فقط بشكل انتقائي إلى شكلها غير المضغوط.
يتضمن الإصدار أوزان النموذج بموجب ترخيص أبل لأبحاث التعلم الآلي (Apple Machine Learning Research Model License) والكود المصدري بموجب ترخيص أبل للكود العيني (Apple Sample Code License). وهو مبني على تعديلات لهندسة Qen ويأتي مع ورقة بحثية بعنوان "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" متاحة على arXiv.
يتيح هذا النهج للنموذج التعامل مع التمثيلات المرئية للنص من خلال التركيز على الموارد الحسابية فقط في التفاصيل الضرورية، مما قد يحسن الكفاءة في معالجة المستندات الكبيرة.