Meta выпустила Muse Glimmer, плотную мультимодельную модель на 30 миллиардов параметров, оптимизированную для постоянно работающих локальных рабочих процессов агентов. Веса доступны под лицензией Apache 2.0.
- Квантована до ~4 бит, модель занимает менее 20 ГБ, оставляя запас для KV-кэша и спекулятивного декодирования на потребительском оборудовании с 24 или 32 ГБ памяти.
- Поставляется с легковесным драфтером на основе DFlash для спекулятивного декодирования, что обеспечивает значительно более быструю генерацию токенов при идентичном качестве вывода.
- Обучена на 100+ языках с контролируемым усилием рассуждения для баланса между качеством и скоростью.
- Оптимизирована для агентских задач, включая сквозное выполнение задач, вызов функций, многошаговое рассуждение и восстановление после сбоев.
Выпуск направлен на обеспечение эффективного локального выполнения сложных циклов агентов за счет уменьшения объема памяти при сохранении производительности в таких бенчмарках, как DeepSearch QA и SWE-Bench.