Seorang pengembang telah merilis arsitektur Perhatian Linear Kausal O(N) dengan Gerbang Peluruhan secara open-source, yang dilengkapi dengan kernel akumulasi keadaan Triton/CUDA terpadu untuk menghindari hambatan MHA kuadratik.

  • Skala Konteks: Urutan konteks 128K dieksekusi dalam 108.78ms dengan VRAM <185MB pada NVIDIA T4.
  • Akselerasi Kernel: Kernel Triton terpadu memberikan percepatan 3.60x dibandingkan implementasi PyTorch standar.
  • Penjaga Presisi: Menggunakan Akumulator Master FP32 + Normalisasi RMS untuk mencegah overflow gradien FP16/BF16 selama pelatihan konteks panjang.
  • Akurasi Retrieval: Lolos benchmark Needle-In-A-Haystack (NIAH) 16K dengan SNR 1.89x.

Penulis sedang mencari masukan tentang mengintegrasikan model ke dalam Hugging Face Transformers atau melakukan perbandingan benchmark dengan model linear yang ada.