Meta ha lanzado Muse Glimmer, un modelo multimodal denso de 30B parámetros disponible como código abierto en Hugging Face Hub. La arquitectura consiste en un decodificador de texto de 28B y un Perception Encoder estilo ViT de 2B para tareas de visión.
- El decodificador de texto utiliza atención híbrida con ventanas deslizantes y capas de atención completa, junto con Gated Grouped-Query Attention para reducir la memoria KV-cache en 16x.
- El modelo admite inferencia de video procesando fotogramas a 2 fotogramas por segundo, limitando los clips a 96 fotogramas.
- Se proporciona soporte Day-0 para transformers, llama.cpp, vLLM e Inference Endpoints.
- Se incluye un drafters opcional DFlash para decodificación especulativa que acelera la generación, especialmente para contenido estructurado como código.
El lanzamiento permite el despliegue local de capacidades multimodales y agénticas con amplia compatibilidad de hardware entre aceleradores NVIDIA, AMD e Intel.