Apple выпустила LensVLM-9B, модель Vision Language Model на 9 миллиардов параметров, предназначенную для более эффективной обработки сжатых изображений текста. Модель сканирует эти сжатые входные данные и использует изученные инструменты для избирательного расширения только релевантных страниц до их несжатой формы.
В релиз входят веса модели под лицензией Apple Machine Learning Research Model License и исходный код под лицензией Apple Sample Code License. Она построена на основе модификаций архитектуры Qwen и сопровождается статьей «LensVLM: Selective Context Expansion for Compressed Visual Representation of Text», доступной на arXiv.
Этот подход позволяет модели обрабатывать визуальные представления текста, фокусируя вычислительные ресурсы только на необходимых деталях, что потенциально повышает эффективность обработки больших документов.