Para peneliti memperkenalkan SkewAdam, sebuah pengoptimum yang dirancang untuk model campuran-ahli (MoE) yang mengalokasikan jenis keadaan berbeda ke populasi parameter yang berbeda guna secara drastis mengurangi penggunaan memori. Dengan menetapkan momentum float32 dan momen kedua terfaktor pada tulang punggung, momen kedua terfaktor pada ahli, dan momen kedua tepat pada perute, SkewAdam mengurangi keadaan pengoptimum dari 50,6 GB menjadi 1,29 GB untuk model dengan 6,78B parameter.

  • Memori pelatihan puncak turun dari 81,4 GB menjadi 31,3 GB, muat dalam anggaran akselerator 40 GB.
  • SkewAdam mencapai kerumitan validasi sebesar 108,4 atas 82M token, mengungguli AdamW (126,8), Muon (120,2), dan Lion (393,7).
  • Penghematan memori dicapai tanpa kehilangan akurasi; peningkatan kinerja berasal dari mempertahankan momentum daripada alokasi bertingkat itu sendiri.

Hasilnya menunjukkan bahwa tempat keadaan pengoptimum dialokasikan sama pentingnya dengan volumenya, memungkinkan pelatihan efisien pada perangkat keras dengan memori terbatas.