Meta telah merilis Muse Glimmer, model multimodal padat 30 miliar parameter yang dioptimalkan untuk alur kerja agen lokal yang selalu aktif. Bobotnya tersedia di bawah lisensi Apache 2.0.

  • Dikuantisasi ke ~4-bit, model ini muat dalam kurang dari 20 GB, menyisakan ruang bagi cache KV dan dekode spekulatif pada perangkat konsumen dengan memori 24 GB atau 32 GB.
  • Dilengkapi dengan drafter ringan berbasis DFlash untuk dekode spekulatif, memungkinkan generasi token yang jauh lebih cepat dengan kualitas output yang identik.
  • Dilatih pada 100+ bahasa dengan upaya penalaran yang dapat dikontrol untuk menyeimbangkan kualitas dan kecepatan.
  • Dioptimalkan untuk tugas agentic termasuk penyelesaian tugas end-to-end, pemanggilan fungsi, penalaran multi-langkah, dan pemulihan kegagalan.

Rilis ini bertujuan untuk memungkinkan eksekusi lokal yang efisien dari loop agen kompleks dengan mengurangi jejak memori sambil mempertahankan kinerja pada benchmark seperti DeepSearch QA dan SWE-Bench.