苹果为其第三代基础模型(AFM3)引入了一种新架构,利用“指令跟随剪枝”大幅减少活跃参数数量。该模型设计为每次提示仅进行一次路由决策,从而激活其 MLP 层的大约 20%,而非每个 token 一次。
- 系统将完整模型保留在闪存中,并在任意时刻仅将一小部分“专家”参数(10亿至40亿之间)加载到工作内存中。
- 共享专家的核心部分始终保持激活状态,其余参数则根据输入提示按需加载。
- 这种方法使得 30B 活跃 MoE 能够实现与 14B 活跃模型相当的读取带宽性能,并有效将 9B 稠密模型转化为 3B 活跃模型。
该方法旨在通过稀疏激活模式在保持性能的同时最小化内存使用,从而提高效率。