Un desarrollador ha liberado como código abierto una arquitectura de Atención Lineal Causal O(N) con compuerta de decaimiento que incluye núcleos de acumulación de estado Triton/CUDA fusionados, diseñados para evitar los cuellos de botella de MHA cuadrático.
- Escalado de contexto: secuencia de contexto de 128K ejecutada en 108.78ms con <185MB de VRAM en NVIDIA T4.
- Aceleración del núcleo: el núcleo Triton fusionado ofrece una aceleración de 3.60x frente a la implementación estándar de PyTorch.
- Protección de precisión: utiliza Acumulador Maestro FP32 + Normalización RMS para evitar desbordamiento de gradientes FP16/BF16 durante el entrenamiento con contexto largo.
- Precisión de recuperación: superó el benchmark Needle-In-A-Haystack (NIAH) de 16K con una SNR de 1.89x.
El autor está buscando comentarios sobre la integración del modelo en Hugging Face Transformers o realizando comparaciones de benchmark con modelos lineales existentes.