Apple은 압축된 텍스트 이미지를 더 효율적으로 처리하도록 설계된 90억 파라미터 Vision Language Model인 LensVLM-9B를 출시했습니다. 이 모델은 이러한 압축된 입력을 스캔하고 학습된 도구를 사용하여 관련 페이지만 선택적으로 비압축 형태로 확장합니다.

릴리스에는 Apple Machine Learning Research Model License 하의 모델 가중치와 Apple Sample Code License 하의 소스 코드가 포함됩니다. 이는 Qwen 아키텍처의 수정 사항을 기반으로 구축되었으며 arXiv에서 사용할 수 있는 "LensVLM: Selective Context Expansion for Compressed Visual Representation of Text"라는 제목의 논문도 동반됩니다.

이 접근 방식은 모델이 필요한 세부 정보에만 컴퓨팅 자원을 집중시켜 시각적 텍스트 표현을 처리할 수 있게 하며, 대규모 문서 처리의 효율성을 잠재적으로 향상시킬 수 있습니다.