Разработчик открыл архитектуру причинного линейного внимания O(N) с затуханием, включающую объединённые ядра накопления состояний Triton/CUDA, предназначенные для обхода узких мест квадратичного MHA.

  • Масштабирование контекста: последовательность из 128K токенов выполнена за 108.78 мс при использовании менее 185 МБ видеопамяти на NVIDIA T4.
  • Ускорение ядра: объединённое ядро Triton обеспечивает ускорение в 3.60 раза по сравнению со стандартной реализацией PyTorch.
  • Защита точности: используется мастер-накопитель FP32 + нормализация RMS для предотвращения переполнения градиентов FP16/BF16 при обучении на длинном контексте.
  • Точность поиска: пройдён бенчмарк Needle-In-A-Haystack (NIAH) на 16K токенов с SNR 1.89.

Автор ищет отзывы об интеграции модели в Hugging Face Transformers или проведении сравнительных бенчмарков с существующими линейными моделями.