Meta выпустила Muse Glimmer, мультимодальную модель с 30 миллиардами параметров, дистиллированную из Muse Spark и настроенную для постоянного локального использования в рабочих процессах агентов. Модель доступна под лицензией Apache 2.0 и работает на одном потребительском GPU или Mac без сетевых вызовов.
- Веса сжаты до точности примерно 4 бит, что позволяет модели поместиться в 24 ГБ VRAM всего с потерей точности на 1,0%.
- Блок диффузионного черновика DFlash предсказывает 16 токенов за проход, обеспечивая ускорение в 3,1 раза на RTX 5090 по сравнению со стандартным декодированием.
- Muse Glimmer опережает Gemma4-31B и Qwen3.6-27B в бенчмарках, включая MCP Atlas (75,5), DeepSearch QA (74,6) и SWE-Bench Pro (51,2).
- Модель уступает Qwen3.6-27B на OSWorld-Verified и TerminalBench 2.1, но сохраняет высокую производительность в задачах агентной оркестрации и рассуждений.
Эт релиз позволяет автономную офлайн-работу для регулируемых предприятий и разработчиков, которым требуются локализация данных и низкая задержка без почасовой оплаты за каждый токен.