Los investigadores presentan SkewAdam, un optimizador diseñado para modelos de mezcla de expertos (MoE) que asigna diferentes tipos de estado a poblaciones de parámetros distintas para reducir drásticamente el uso de memoria. Al asignar momento float32 y momentos segundos factorizados al núcleo principal, momentos segundos factorizados a los expertos y momentos segundos exactos al enrutador, SkewAdam reduce el estado del optimizador de 50.6 GB a 1.29 GB para un modelo de 6.78B parámetros.
- La memoria máxima de entrenamiento disminuye de 81.4 GB a 31.3 GB, ajustándose dentro de un presupuesto de acelerador de 40 GB.
- SkewAdam logra una perplejidad de validación de 108.4 en 82M tokens, superando a AdamW (126.8), Muon (120.2) y Lion (393.7).
- Los ahorros de memoria se logran sin pérdida de precisión; la ganancia de rendimiento proviene de retener el momento en lugar de la asignación en niveles en sí misma.
Los resultados sugieren que dónde se asigna el estado del optimizador es tan importante como su volumen, permitiendo un entrenamiento eficiente en hardware con memoria limitada.