한 개발자가 이차적 MHA 병목 현상을 우회하기 위해 설계된 퓨즈드 Triton/CUDA 상태 누적 커널을 갖춘 Decay-Gated O(N) 인과적 선형 어텐션 아키텍처를 오픈소스로 공개했습니다.
- 컨텍스트 스케일링: NVIDIA T4에서 <185MB VRAM으로 128K 컨텍스트 시퀀스를 108.78ms에 실행.
- 커널 가속화: 퓨즈드 Triton 커널이 표준 PyTorch 구현 대비 3.60x 속도 향상을 제공.
- 정밀도 보호: 장기 컨텍스트 학습 중 FP16/BF16 그래디언트 오버플로우를 방지하기 위해 FP32 마스터 누적기 + RMS 정규화를 사용.
- 검색 정확도: 16K Needle-In-A-Haystack (NIAH) 벤치마크에서 1.89x SNR로 통과.
저자는 Hugging Face Transformers에 모델을 통합하거나 기존 선형 모델과의 벤치마크 비교를 진행하는 것에 대한 피드백을 구하고 있습니다.