Metaは、Hugging Face Hubでオープンソースとして利用可能な、30Bパラメータの密集型マルチモーダルモデルであるMuse Glimmerをリリースしました。アーキテクチャは、28Bのテキストデコーダーとビジョンタスク用の2B ViTスタイルPerception Encoderで構成されています。
- テキストデコーダーは、スライディングウィンドウとフルアテンションレイヤーを持つハイブリッドアテンション、およびKVキャッシュメモリを16倍削減するためのGated Grouped-Query Attentionを利用しています。
- モデルは、フレームを秒間2フレームで処理し、クリップを96フレームに制限することで、ビデオ推論をサポートします。
- transformers、llama.cpp、vLLM、Inference Endpointsに対してDay-0サポートが提供されています。
- コーディングなどの構造化コンテンツの生成を加速するために、オプションのDFlashスペキュラティブデコーディングドラフターが含まれています。
このリリースにより、NVIDIA、AMD、Intelアクセラレータにわたる幅広いハードウェア互換性を持つエージェント型マルチモーダル機能をローカルデプロイすることが可能になります。