Meta는 항상 켜져 있는 로컬 에이전트 워크플로우에 최적화된 300억 파라미터 밀집 멀티모달 모델인 Muse Glimmer를 출시했습니다. 가중치는 Apache 2.0 라이선스 하에 제공됩니다.

  • 양자화되어 약 4비트에 도달했으며, 이 모델은 20GB 미만으로 수납되어 24GB 또는 32GB 메모리를 갖춘 소비자용 하드웨어에서 KV 캐시와 추론 디코딩을 위한 여유 공간을 확보합니다.
  • 추론 디코딩을 위해 경량 DFlash 기반 드래프터가 포함되어 있어 동일한 출력 품질로 훨씬 더 빠른 토큰 생성을 가능하게 합니다.
  • 100개 이상의 언어로 학습되었으며, 품질과 속도를 균형 있게 맞추기 위해 제어 가능한 추론 노력을 제공합니다.
  • 끝에서 끝까지의 작업 완료, 함수 호출, 다단계 추론 및 실패 복구 등 에이전트 작업에 최적화되었습니다.

이번 출시는 DeepSearch QA와 SWE-Bench 같은 벤치마크에서의 성능을 유지하면서 메모리 사용량을 줄여 복잡한 에이전트 루프의 효율적인 로컬 실행을 가능하게 하는 것을 목표로 합니다.