Apple telah merilis LensVLM-9B, sebuah Model Bahasa Visual dengan 9 miliar parameter yang dirancang untuk memproses gambar teks terkompresi lebih efisien. Model ini memindai input terkompresi tersebut dan menggunakan alat-alat yang dipelajari untuk secara selektif memperluas hanya halaman-halaman relevan ke bentuk tidak terkompresinya.

Rilis ini mencakup bobot model di bawah Lisensi Riset Pembelajaran Mesin Apple dan kode sumber di bawah Lisensi Kode Sampel Apple. Model ini dibangun berdasarkan modifikasi pada arsitektur Qwen dan disertai dengan makalah berjudul "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" yang tersedia di arXiv.

Pendekatan ini memungkinkan model menangani representasi teks visual dengan memfokuskan sumber daya komputasi hanya pada detail yang diperlukan, berpotensi meningkatkan efisiensi dalam pemrosesan dokumen besar.