Meta ha lanzado Muse Glimmer, un modelo multimodal de 30 mil millones de parámetros destilado de Muse Spark y ajustado para flujos de trabajo de agentes locales siempre activos. El modelo está disponible bajo la licencia Apache 2.0 y funciona en una única GPU para consumidores o Mac sin llamadas a la red.
- Los pesos están comprimidos a aproximadamente precisión de 4 bits, permitiendo que el modelo quepa en 24 GB de VRAM con solo una degradación de precisión del 1.0%.
- El borrador de difusión por bloques DFlash predice 16 tokens por pasada, ofreciendo una aceleración de 3.1x en una RTX 5090 en comparación con la decodificación estándar.
- Muse Glimmer lidera a Gemma4-31B y Qwen3.6-27B en benchmarks que incluyen MCP Atlas (75.5), DeepSearch QA (74.6) y SWE-Bench Pro (51.2).
- El modelo va por detrás de Qwen3.6-27B en OSWorld-Verified y TerminalBench 2.1 pero mantiene un rendimiento sólido en tareas de orquestación agente y razonamiento.
Este lanzamiento permite la operación autoalojada y sin conexión para empresas reguladas y desarrolladores que requieren residencia de datos y baja latencia sin facturación por token.