研究人员推出了 SkewAdam,这是一种专为混合专家(MoE)模型设计的优化器,它向不同的参数群体分配不同类型的状态,从而大幅降低内存使用量。通过将 float32 动量和分解的二阶矩分配给主干网络,将分解的二阶矩分配给专家,并将精确的二阶矩分配给路由器,SkewAdam 将 6.78B 参数模型的优化器状态从 50.6 GB 减少到 1.29 GB。

  • 峰值训练内存从 81.4 GB 降至 31.3 GB,符合 40 GB 加速器预算。
  • SkewAdam 在 82M token 上实现了 108.4 的验证困惑度,优于 AdamW (126.8)、Muon (120.2) 和 Lion (393.7)。
  • 内存节省并未造成精度损失;性能提升源于保留动量,而非分层分配本身。

结果表明,优化器状态的分配位置与其体积同样重要,从而能够在内存有限的硬件上实现高效训练。