Meta ha lanzado Muse Glimmer, un modelo multimodal denso de 30B parámetros disponible como código abierto en Hugging Face Hub. La arquitectura consiste en un decodificador de texto de 28B y un Perception Encoder estilo ViT de 2B para tareas de visión.

  • El decodificador de texto utiliza atención híbrida con ventanas deslizantes y capas de atención completa, junto con Gated Grouped-Query Attention para reducir la memoria KV-cache en 16x.
  • El modelo admite inferencia de video procesando fotogramas a 2 fotogramas por segundo, limitando los clips a 96 fotogramas.
  • Se proporciona soporte Day-0 para transformers, llama.cpp, vLLM e Inference Endpoints.
  • Se incluye un drafters opcional DFlash para decodificación especulativa que acelera la generación, especialmente para contenido estructurado como código.

El lanzamiento permite el despliegue local de capacidades multimodales y agénticas con amplia compatibilidad de hardware entre aceleradores NVIDIA, AMD e Intel.