Un desarrollador ha liberado como código abierto una arquitectura de Atención Lineal Causal O(N) con compuerta de decaimiento que incluye núcleos de acumulación de estado Triton/CUDA fusionados, diseñados para evitar los cuellos de botella de MHA cuadrático.

  • Escalado de contexto: secuencia de contexto de 128K ejecutada en 108.78ms con <185MB de VRAM en NVIDIA T4.
  • Aceleración del núcleo: el núcleo Triton fusionado ofrece una aceleración de 3.60x frente a la implementación estándar de PyTorch.
  • Protección de precisión: utiliza Acumulador Maestro FP32 + Normalización RMS para evitar desbordamiento de gradientes FP16/BF16 durante el entrenamiento con contexto largo.
  • Precisión de recuperación: superó el benchmark Needle-In-A-Haystack (NIAH) de 16K con una SNR de 1.89x.

El autor está buscando comentarios sobre la integración del modelo en Hugging Face Transformers o realizando comparaciones de benchmark con modelos lineales existentes.