Um desenvolvedor abriu o código-fonte de uma arquitetura de Atenção Linear Causal O(N) com Gating de Decaimento, apresentando kernels de acumulação de estado fundidos Triton/CUDA projetados para contornar os gargalos do MHA quadrático.

  • Escalonamento de Contexto: Sequência de contexto de 128K executada em 108,78ms com <185MB de VRAM na NVIDIA T4.
  • Aceleração de Kernel: O kernel Triton fundido oferece um aumento de velocidade de 3,60x em relação à implementação padrão do PyTorch.
  • Proteção de Precisão: Utiliza Acumulador Mestre FP32 + Normalização RMS para evitar estouro de gradiente FP16/BF16 durante o treinamento com contexto longo.
  • Precisão de Recuperação: Passou no benchmark Needle-In-A-Haystack (NIAH) de 16K com SNR de 1,89x.

O autor está buscando feedback sobre a integração do modelo no Hugging Face Transformers ou a realização de comparações de benchmark com modelos lineares existentes.