Jen Wei encontró una espiral de muerte de la tasa de aprendizaje al probar AdamW, Muon y la última implementación de Dion3 dentro de OLMo-core para una próxima charla en la Conferencia PyTorch.
- El proceso de depuración reveló problemas relacionados con el estado del optimizador distribuido y la programación de la tasa de aprendizaje (LR).
- Se identificó un truco específico de aliasing de tensores de PyTorch como una causa clave de la inestabilidad.
- Wei documentó toda la aventura de depuración en Medium para ayudar a otros a evitar trampas de memoria similares en optimizadores distribuidos.