来源 · arXiv cs.LG
arxiv arXiv cs.LG · 24 天前 · 8 次浏览

SkewAdam 使用分层优化器状态将 MoE 训练内存降低 97%

研究人员推出了 SkewAdam,这是一种专为混合专家(MoE)模型设计的优化器,它向不同的参数群体分配不同类型的状态,从而大幅降低内存使用量。通过将 float32 动量和分解的二阶矩分配给主干网络,将分解的二阶矩分配给专家,并将精确的二阶矩分配给路由器,SkewAdam 将 6.78B 参数模型的优化器状态从 50.6 GB 减少到 1.29 GB。