Meta выпустила Muse Glimmer, плотную мультимодельную модель с 30B параметров, доступную как открытый исходный код на Hugging Face Hub. Архитектура состоит из текстового декодера на 28B и ViT-подобного Perception Encoder на 2B для задач зрения.

  • Текстовый декодер использует гибридное внимание с скользящими окнами и полными слоями внимания, а также Gated Grouped-Query Attention для снижения памяти KV-cache в 16 раз.
  • Модель поддерживает видеоинференс, обрабатывая кадры со скоростью 2 кадра в секунду, ограничивая клипы до 96 кадров.
  • Поддержка Day-0 предоставляется для transformers, llama.cpp, vLLM и Inference Endpoints.
  • Включен необязательный драфтер DFlash для спекулятивного декодирования, ускоряющий генерацию, особенно для структурированного контента, такого как код.

Выпуск позволяет локально разворачивать агентные мультимодальные возможности с широкой совместимостью оборудования среди ускорителей NVIDIA, AMD и Intel.