Meta a publié Muse Glimmer, un modèle multimodal de 30 milliards de paramètres distillé à partir de Muse Spark et optimisé pour les flux de travail d'agents locaux toujours actifs. Le modèle est disponible sous licence Apache 2.0 et s'exécute sur un seul GPU grand public ou Mac sans appels réseau.
- Les poids sont compressés à une précision d'environ 4 bits, permettant au modèle de tenir dans 24 Go de VRAM avec seulement 1,0 % de dégradation de la précision.
- Le bloc de rédaction par diffusion en blocs DFlash prédit 16 tokens par passe, offrant un gain de vitesse de 3,1x sur une RTX 5090 par rapport au décodage standard.
- Muse Glimmer devance Gemma4-31B et Qwen3.6-27B sur les benchmarks incluant MCP Atlas (75,5), DeepSearch QA (74,6) et SWE-Bench Pro (51,2).
- Le modèle est inférieur à Qwen3.6-27B sur OSWorld-Verified et TerminalBench 2.1 mais maintient des performances solides dans les tâches d'orchestration agentique et de raisonnement.
Cette publication permet une opération auto-hébergée et hors ligne pour les entreprises réglementées et les développeurs qui nécessitent la résidence des données et une faible latence sans facturation par token.