Metaは、Hugging Face Hubでオープンソースとして利用可能な、30Bパラメータの密集型マルチモーダルモデルであるMuse Glimmerをリリースしました。アーキテクチャは、28Bのテキストデコーダーとビジョンタスク用の2B ViTスタイルPerception Encoderで構成されています。

  • テキストデコーダーは、スライディングウィンドウとフルアテンションレイヤーを持つハイブリッドアテンション、およびKVキャッシュメモリを16倍削減するためのGated Grouped-Query Attentionを利用しています。
  • モデルは、フレームを秒間2フレームで処理し、クリップを96フレームに制限することで、ビデオ推論をサポートします。
  • transformers、llama.cpp、vLLM、Inference Endpointsに対してDay-0サポートが提供されています。
  • コーディングなどの構造化コンテンツの生成を加速するために、オプションのDFlashスペキュラティブデコーディングドラフターが含まれています。

このリリースにより、NVIDIA、AMD、Intelアクセラレータにわたる幅広いハードウェア互換性を持つエージェント型マルチモーダル機能をローカルデプロイすることが可能になります。