Metaは、Muse Sparkから蒸留され、常時オンローカルのエージェントワークフロー向けにチューニングされた300億パラメータのマルチモーダルモデルであるMuse Glimmerをリリースした。本モデルはApache 2.0ライセンスの下で提供され、ネットワーク呼び出しなしで1枚のコンシューマーGPUまたはMac上で動作する。

  • 重みは約4ビット精度に圧縮されており、精度低下がわずか1.0%にとどまる状態で24 GB VRAMに収まる。
  • DFlashブロック拡散ドラフティングにより、1パスあたり16トークンを予測し、RTX 5090上で標準的なデコーディングと比較して3.1倍の高速化を実現する。
  • Muse Glimmerは、MCP Atlas (75.5)、DeepSearch QA (74.6)、SWE-Bench Pro (51.2) を含むベンチマークでGemma4-31BおよびQwen3.6-27Bを上回る。
  • OSWorld-VerifiedおよびTerminalBench 2.1ではQwen3.6-27Bに劣るものの、エージェントオーケストレーションおよび推論タスクにおいて強力なパフォーマンスを維持している。

このリリースにより、データ居住性と低レイテンシーが必須で、トークンごとの課金を受け入れられない規制対象の企業や開発者向けに、セルフホスト型オフライン運用が可能となる。