Meta выпустила Muse Glimmer, плотную мультимодельную модель с 30B параметров, доступную как открытый исходный код на Hugging Face Hub. Архитектура состоит из текстового декодера на 28B и ViT-подобного Perception Encoder на 2B для задач зрения.
- Текстовый декодер использует гибридное внимание с скользящими окнами и полными слоями внимания, а также Gated Grouped-Query Attention для снижения памяти KV-cache в 16 раз.
- Модель поддерживает видеоинференс, обрабатывая кадры со скоростью 2 кадра в секунду, ограничивая клипы до 96 кадров.
- Поддержка Day-0 предоставляется для transformers, llama.cpp, vLLM и Inference Endpoints.
- Включен необязательный драфтер DFlash для спекулятивного декодирования, ускоряющий генерацию, особенно для структурированного контента, такого как код.
Выпуск позволяет локально разворачивать агентные мультимодальные возможности с широкой совместимостью оборудования среди ускорителей NVIDIA, AMD и Intel.