Apple ने LensVLM-9B जारी किया है, जो 9 अरब पैरामीटर वाला एक Vision Language Model है जिसे पाठ की संपीड़ित छवियों को अधिक कुशलता से प्रसंस्कृत करने के लिए डिज़ाइन किया गया है। मॉडल इन संपीड़ित इनपुट्स को स्कैन करता है और सीखे गए टूल्स का उपयोग करके केवल प्रासंगिक पृष्ठों को उनके अविस्तारित रूप में चयनात्मक रूप से विस्तारित करता है।

रिलीज़ में Apple Machine Learning Research Model License के तहत मॉडल वेट्स और Apple Sample Code License के तहत स्रोत कोड शामिल हैं। यह Qwen आर्किटेक्चर में संशोधनों पर बनाया गया है और इसमें arXiv पर उपलब्ध "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text" शीर्षक का एक पेपर भी है।

यह दृष्टिकोण मॉडल को दृश्य पाठ निरूपणों को संभालने देता है, केवल आवश्यक विवरणों पर कंप्यूटेशनल संसाधनों को केंद्रित करके, बड़े दस्तावेजों के प्रसंस्करण में कुशलता को बढ़ावा देने की क्षमता रखता है।