Meta 发布了 Muse Glimmer,这是一个拥有 30B 参数的密集多模态模型,作为开源项目托管在 Hugging Face Hub 上。该架构由一个 28B 的文本解码器和一个用于视觉任务的 2B ViT 风格 Perception Encoder 组成。
- 文本解码器利用带有滑动窗口的混合注意力和全注意力层,以及 Gated Grouped-Query Attention,将 KV-cache 内存减少 16 倍。
- 该模型支持视频推理,以每秒 2 帧的速度处理帧,并将片段限制为 96 帧。
- 为 transformers、llama.cpp、vLLM 和 Inference Endpoints 提供 Day-0 支持。
- 包含一个可选的 DFlash 推测解码草稿器,用于加速生成,特别是针对编码等结构化内容。
此次发布使得在 NVIDIA、AMD 和 Intel 加速器上广泛兼容硬件的情况下,本地部署代理式多模态能力成为可能。