Pesquisadores apresentam o SkewAdam, um otimizador projetado para modelos mixture-of-experts (MoE) que aloca diferentes tipos de estado para populações distintas de parâmetros, reduzindo drasticamente o uso de memória. Ao atribuir momento float32 e momentos segundos fatorados ao backbone, momentos segundos fatorados aos experts e momentos segundos exatos ao roteador, o SkewAdam reduz o estado do otimizador de 50,6 GB para 1,29 GB em um modelo com 6,78B de parâmetros.
- A memória máxima de treinamento cai de 81,4 GB para 31,3 GB, cabendo dentro de um orçamento de acelerador de 40 GB.
- O SkewAdam alcança uma perplexidade de validação de 108,4 em 82M de tokens, superando AdamW (126,8), Muon (120,2) e Lion (393,7).
- A economia de memória é obtida sem perda de precisão; o ganho de desempenho decorre da retenção do momento, e não da alocação em camadas em si.
Os resultados sugerem que onde o estado do otimizador é alocado importa tanto quanto seu volume, permitindo treinamento eficiente em hardware com memória limitada.