Meta는 Muse Spark에서 증류되고 항상 활성화된 로컬 에이전트 워크플로우에 맞게 조정된 300억 파라미터의 멀티모달 모델인 Muse Glimmer를 출시했습니다. 이 모델은 Apache 2.0 라이선스 하에 제공되며, 네트워크 호출 없이 단일 소비자용 GPU 또는 Mac에서 실행됩니다.
- 가중치는 약 4비트 정밀도로 압축되어 정확도 저하가 단 1.0%에 그치면서 24 GB VRAM에 적합합니다.
- DFlash 블록 확산 드래프팅은 한 번의 전달당 16개의 토큰을 예측하여 표준 디코딩 대비 RTX 5090에서 3.1배 속도 향상을 제공합니다.
- Muse Glimmer는 MCP Atlas (75.5), DeepSearch QA (74.6), SWE-Bench Pro (51.2)를 포함한 벤치마크에서 Gemma4-31B와 Qwen3.6-27B를 선도합니다.
- 이 모델은 OSWorld-Verified와 TerminalBench 2.1에서는 Qwen3.6-27B에 뒤처지지만, 에이전트 오케스트레이션 및 추론 작업에서 강력한 성능을 유지합니다.
이 릴리스는 데이터 주권과 토큰 단위 과금 없이 낮은 지연 시간이 필요한 규제 기업 및 개발자를 위한 자체 호스팅 오프라인 운영을 가능하게 합니다.