Meta发布了Muse Glimmer,这是一个拥有300亿参数的多模态模型,由Muse Spark蒸馏而来,并针对始终在线的本地智能体工作流进行了调优。该模型采用Apache 2.0许可证发布,可在单张消费级GPU或Mac上运行,无需进行网络调用。
- 权重被压缩至约4位精度,使模型仅需24 GB显存即可容纳,且准确率仅下降1.0%。
- DFlash块扩散草稿预测每轮可预测16个token,在RTX 5090上相比标准解码实现了3.1倍的速度提升。
- Muse Glimmer在包括MCP Atlas (75.5)、DeepSearch QA (74.6)和SWE-Bench Pro (51.2)在内的基准测试中领先于Gemma4-31B和Qwen3.6-27B。
- 该模型在OSWorld-Verified和TerminalBench 2.1上落后于Qwen3.6-27B,但在智能体编排和推理任务中保持了强劲的性能。
此发布使得受监管企业和需要数据驻留、低延迟且无需按token计费的开发者能够实现自托管和离线运行。