Un développeur a mis en open-source une architecture d'attention linéaire causale O(N) à portes de décroissance, dotée de noyaux d'accumulation d'état Triton/CUDA fusionnés conçus pour contourner les goulots d'étranglement de l'attention multi-têtes quadratique.
- Mise à l'échelle du contexte : séquence de contexte 128K exécutée en 108,78 ms avec <185 Mo de VRAM sur NVIDIA T4.
- Accélération par noyau : le noyau Triton fusionné offre un gain de vitesse de 3,60x par rapport à l'implémentation standard de PyTorch.
- Protection de la précision : utilise un accumulateur maître FP32 + normalisation RMS pour prévenir le débordement des gradients FP16/BF16 lors de l'entraînement sur de longs contextes.
- Précision de la récupération : a réussi le benchmark Needle-In-A-Haystack (NIAH) 16K avec un SNR de 1,89x.
L'auteur sollicite des retours sur l'intégration du modèle dans Hugging Face Transformers ou sur la réalisation de comparaisons de benchmarks avec les modèles linéaires existants.