A Meta lançou o Muse Glimmer, um modelo multimodal denso de 30B parâmetros disponível como código aberto no Hugging Face Hub. A arquitetura consiste em um decodificador de texto de 28B e um Perception Encoder estilo ViT de 2B para tarefas de visão.

  • O decodificador de texto utiliza atenção híbrida com janelas deslizantes e camadas de atenção completa, juntamente com Gated Grouped-Query Attention para reduzir a memória KV-cache em 16x.
  • O modelo suporta inferência de vídeo processando quadros a 2 quadros por segundo, limitando os clipes a 96 quadros.
  • Suporte Day-0 é fornecido para transformers, llama.cpp, vLLM e Inference Endpoints.
  • Um drafters opcional DFlash para decodificação especulativa está incluído para acelerar a geração, especialmente para conteúdo estruturado como código.

O lançamento permite a implantação local de capacidades multimodais e agênticas com ampla compatibilidade de hardware entre aceleradores NVIDIA, AMD e Intel.