Appleは、テキストの圧縮画像をより効率的に処理するために設計された90億パラメータのVision Language ModelであるLensVLM-9Bをリリースしました。このモデルはこれらの圧縮入力をスキャンし、学習したツールを使用して関連するページのみを選択的に非圧縮形式に拡張します。

リリースにはApple Machine Learning Research Model Licenseの下でのモデルウェイトと、Apple Sample Code Licenseの下でのソースコードが含まれています。これはQwenアーキテクチャへの変更に基づいて構築されており、arXivで入手可能な「LensVLM: Selective Context Expansion for Compressed Visual Representation of Text」というタイトルの論文も付属しています。

このアプローチにより、モデルは必要な詳細に計算リソースを集中させることで視覚的テキスト表現を処理でき、大規模なドキュメントの処理効率を向上させる可能性があります。