Meta 发布了 Muse Glimmer,这是一款拥有 300 亿参数的密集多模态模型,专为始终在线的本地智能体工作流而优化。该模型的权重在 Apache 2.0 许可证下开放。

  • 量化至约 4-bit,模型大小低于 20 GB,为消费级硬件上 24 GB 或 32 GB 内存中的 KV 缓存和推测性解码留出余量。
  • 附带基于 DFlash 的轻量级草稿生成器用于推测性解码,在保持相同输出质量的同时显著加快 token 生成速度。
  • 使用 100 多种语言进行训练,并具备可控推理能力以平衡质量和速度。
  • 针对智能体任务进行了优化,包括端到端任务完成、函数调用、多步推理和故障恢复。

此次发布旨在通过减小内存占用同时保持 DeepSearch QA 和 SWE-Bench 等基准测试的性能,实现复杂智能体循环的高效本地执行。