一位开发者开源了衰减门控O(N)因果线性注意力架构,该架构包含融合的Triton/CUDA状态累积内核,旨在绕过二次MHA瓶颈。
- 上下文扩展:在NVIDIA T4上以<185MB显存执行128K上下文序列,耗时108.78ms。
- 内核加速:融合Triton内核相比标准PyTorch实现实现了3.60倍的速度提升。
- 精度保障:使用FP32主累加器+RMS归一化来防止长上下文训练期间FP16/BF16梯度溢出。
- 检索准确率:在16K Needle-In-A-Haystack (NIAH)基准测试中通过,信噪比(SNR)为1.89x。
作者正在寻求关于将模型集成到Hugging Face Transformers或进行与现有线性模型基准比较的反馈。