Meta는 Hugging Face Hub에서 오픈 소스로 제공되는 밀집형 30B 파라미터 멀티모달 모델인 Muse Glimmer를 출시했습니다. 아키텍처는 28B 텍스트 디코더와 비전 작업을 위한 2B ViT 스타일 Perception Encoder로 구성됩니다.
- 텍스트 디코더는 슬라이딩 윈도우와 전체 어텐션 레이어가 있는 하이브리드 어텐션과 KV-cache 메모리를 16배 줄이는 Gated Grouped-Query Attention을 사용합니다.
- 모델은 초당 2프레임으로 프레임을 처리하고 클립을 96프레임으로 제한하여 비디오 추론을 지원합니다.
- transformers, llama.cpp, vLLM 및 Inference Endpoints에 대한 Day-0 지원이 제공됩니다.
- 코딩과 같은 구조화된 콘텐츠의 생성을 가속화하기 위해 선택적 DFlash 스펜크티브 디코딩 드래프터가 포함되어 있습니다.
이번 출시로 NVIDIA, AMD 및 Intel 가속기 전반에 걸친 광범위한 하드웨어 호환성을 갖춘 에이전트형 멀티모달 기능을 로컬 배포할 수 있게 되었습니다.