Meta telah merilis Muse Glimmer, model multimodal 30 miliar parameter yang didistilasi dari Muse Spark dan disetel untuk alur kerja agen lokal yang selalu aktif. Model ini tersedia di bawah lisensi Apache 2.0 dan berjalan pada satu GPU konsumen atau Mac tanpa panggilan jaringan.

  • Bobot dikompresi hingga presisi sekitar 4-bit, memungkinkan model muat dalam VRAM 24 GB dengan degradasi akurasi hanya 1,0%.
  • Drafting difusi blok DFlash memprediksi 16 token per lemparan, memberikan percepatan kecepatan 3,1x pada RTX 5090 dibandingkan dekoding standar.
  • Muse Glimmer memimpin Gemma4-31B dan Qwen3.6-27B pada benchmark termasuk MCP Atlas (75,5), DeepSearch QA (74,6), dan SWE-Bench Pro (51,2).
  • Model ini tertinggal dari Qwen3.6-27B pada OSWorld-Verified dan TerminalBench 2.1 tetapi mempertahankan kinerja kuat dalam tugas orkestrasi agen dan penalaran.

Rilis ini memungkinkan operasi mandiri dan offline untuk perusahaan yang diatur serta pengembang yang memerlukan residensi data dan latensi rendah tanpa penagihan per-token.