Jen Wei encontrou uma espiral de morte da taxa de aprendizado ao testar AdamW, Muon e a implementação mais recente do Dion3 dentro do OLMo-core para uma próxima palestra na Conferência PyTorch.

  • O processo de depuração revelou problemas envolvendo o estado do otimizador distribuído e o agendamento da taxa de aprendizado (LR).
  • Uma armadilha específica de aliasing de tensores do PyTorch foi identificada como uma causa-chave da instabilidade.
  • Wei documentou toda a aventura de depuração no Medium para ajudar outros a evitar armadilhas de memória semelhantes em otimizadores distribuídos.