苹果发布了 LensVLM-9B,这是一个拥有 90 亿参数的视觉语言模型,旨在更高效地处理文本的压缩图像。该模型扫描这些压缩输入,并利用学习到的工具选择性地将相关页面扩展为其未压缩形式。
此次发布包括在 Apple Machine Learning Research Model License 下的模型权重和在 Apple Sample Code License 下的源代码。它基于对 Qwen 架构的修改构建,并附带一篇题为“LensVLM: Selective Context Expansion for Compressed Visual Representation of Text”的论文,可在 arXiv 上获取。
这种方法使模型能够通过仅关注必要的细节来处理视觉文本表示,从而潜在地提高处理大型文档的效率。