Meta发布了Muse Glimmer,这是一个拥有120K+上下文窗口的30B密集参数模型,专为本地AI智能体工作设计。该模型针对NVIDIA边缘、桌面和工作站平台进行了优化,在单张GPU上可实现20K tokens/sec的推理速度。

  • 模型大小:30B参数,密集架构。
  • 上下文窗口:120K+ tokens。
  • 性能:单张GPU上达到20K tokens/sec。
  • 目标硬件:NVIDIA边缘、桌面和工作站AI平台。

此次发布使得常驻智能体能够在本地处理数据并执行复杂工作流,而无需依赖云基础设施。