Metaは、常時稼働するローカルエージェントワークフローに最適化された300億パラメータの密なマルチモーダルモデルであるMuse Glimmerをリリースした。重みはApache 2.0ライセンスの下で公開されている。
- ~4ビットに量子化され、モデルは20 GB未満に収まり、24 GBまたは32 GBのメモリを持つコンシューマーハードウェア上でKVキャッシュや推論デコーディングのための余裕を残す。
- 推論デコーディング用に軽量なDFlashベースのドラフターを搭載し、同じ出力品質で大幅に高速なトークン生成を可能にする。
- 100以上の言語でトレーニングされ、品質と速度のバランスを取るために制御可能な推論努力を提供する。
- エンドツーエンドのタスク完了、関数呼び出し、多段階推論、障害回復を含むエージェントタスク向けに最適化されている。
このリリースは、DeepSearch QAやSWE-Benchなどのベンチマークでのパフォーマンスを維持しつつメモリフットプリントを削減することで、複雑なエージェントループの効率的なローカル実行を可能にすることを目指している。