Meta a lancé Muse Glimmer, un modèle multimodal dense de 30B paramètres disponible en open source sur le Hugging Face Hub. L'architecture est composée d'un décodeur texte de 28B et d'un Perception Encoder de style ViT de 2B pour les tâches de vision.

  • Le décodeur texte utilise une attention hybride avec des fenêtres glissantes et des couches d'attention complète, ainsi que Gated Grouped-Query Attention pour réduire la mémoire KV-cache de 16x.
  • Le modèle prend en charge l'inférence vidéo en traitant les images à raison de 2 images par seconde, limitant les clips à 96 images.
  • Un support Day-0 est fourni pour transformers, llama.cpp, vLLM et Inference Endpoints.
  • Un drafters optionnel DFlash pour le décodage spéculatif est inclus pour accélérer la génération, en particulier pour le contenu structuré comme le code.

La publication permet le déploiement local de capacités multimodales et agentic avec une large compatibilité matérielle entre les accélérateurs NVIDIA, AMD et Intel.