研究人员提出减少矩阵乘法(RMM),这是一种无需训练、输入自适应的推理方法,通过在收缩维度上选择信息丰富的切片来降低 Transformer 矩阵乘积,而无需修改模型权重。在简单的保留率控制下,RMM 在参数量从 1B 到 70B 的语言模型中提供了平滑且可预测的精度-效率权衡。
- 约简容限取决于模型家族、任务、组件和保留率,通常随着模型规模的增大而改善。
- 在适度约简下,RMM 在判别式、自回归生成和长上下文设置中保持稳健。
- 该原理可扩展至多模态视觉-语言推理。
- 机制性消融研究表明,注意力侧的计算比 MLP 组件具有更高的可约简性。
- 在 NVIDIA A100 上的墙钟基准测试显示出了实际的运行时增益,尤其是在更长的序列长度下。
这些结果将 RMM 定位为输入自适应推理时优化的可扩展方向。