Meta telah merilis Muse Glimmer, sebuah model multimodal padat dengan 30B parameter yang tersedia sebagai open source di Hugging Face Hub. Arsitekturnya terdiri dari decoder teks 28B dan Perception Encoder gaya ViT 2B untuk tugas visi.
- Decoder teks menggunakan perhatian hibrida dengan jendela geser dan lapisan perhatian penuh, bersama dengan Gated Grouped-Query Attention untuk mengurangi memori KV-cache sebesar 16x.
- Model ini mendukung inferensi video dengan memproses frame pada kecepatan 2 frame per detik, membatasi klip hingga 96 frame.
- Dukungan Day-0 disediakan untuk transformers, llama.cpp, vLLM, dan Inference Endpoints.
- Sebuah drafters opsional DFlash untuk decoding spekulatif disertakan untuk mempercepat generasi, terutama untuk konten terstruktur seperti coding.
Rilis ini memungkinkan penyebaran lokal kemampuan multimodal agentic dengan kompatibilitas perangkat keras yang luas di antara akselerator NVIDIA, AMD, dan Intel.