StreamKL вводит синтезированную GPU-примитив, которая устраняет квадратичное использование памяти в дистилляции внимания за счёт потока кусков запрос-ключ через внутреннюю память SRAM. Оно обеспечивает ускорение до 43 раз в прямом и до 14 раз в обратном проходе, снижая дополнительную площадь HBM от O(N_QN_K) до O(1), что позволяет проводить дистилляцию длинных контекстов на одном GPU.
StreamKL: Быстрый и память-эффективный KL-разброс для дистилляции внимания
Устранение проблемы с длительными контекстами при декодировании на Radeon R9700 с использованием vLLM 0.22.1
Проблема с производительностью при длительных контекстах на AMD Radeon AI PRO R9700 (RDNA4) была решена в vLLM 0.22.1 путем включения AITER Unified Attention. Исправление включает ослабление гейта CDNA для включения RDNA4, отключение других реализаций внимания и использование KV-кэша в формате bf16, что обеспечивает значительное ускорение при всех длинах контекста. Использование FP8 на этом оборудовании неэффективно, а нативный контекст модели в размере 262K полностью достижим при использовании bf16, обеспечивая ~2.9× параллелизм без необходимости использования FP8.
FoMoE преодолевает порог полных копий с помощью разделенных экспертных слоев
FoMoE представляет систему, которая распределяет экспертные слои между рабочими узлами, чтобы избежать полных копий модели, снижая затраты на коммуникацию на 1,42 раза по сравнению с базовыми вариантами и на 45,44 раза по сравнению с DDP. Система достигает увеличения производительности до 1,4 раза за счёт механизма пропуска токенов и демонстрирует стабильную маршрутизацию, с прогнозируемыми преимуществами, распространяющимися на модели масштаба 100B, за счёт системного моделирования.
FoMoE преодолевает порог полных копий с помощью разделенных экспертиз слоев
FoMoE представляет систему, которая распределяет экспертизные слои между рабочими, чтобы избежать полных копий модели, снижая затраты на коммуникацию до 1,42 раза по сравнению с эффективными базовыми вариантами и до 45,44 раза по сравнению с DDP. Система достигает увеличения производительности до 1,4 раза за счёт механизма пропуска токенов и демонстрирует стабильную маршрутизацию, с прогнозируемыми преимуществами, распространяющимися на модели масштаба 100B, за счёт системного моделирования.
NVIDIA объясняет выгрузку на хост для устранения узких мест HBM при обучении LLM в JAX
Рабочие нагрузки по обучению больших языковых моделей (LLM) всё чаще упираются в ограничения памяти GPU до полной загрузки вычислительных ресурсов. Веса модели, градиенты, состояния оптимизатора, буферы коммуникации и промежуточные активации конкурируют за ограниченную высокоскоростную память GPU (HBM). По мере увеличения размера модели, длины последовательности и размера батка ёмкость HBM часто становится основным ограничивающим фактором масштабирования.
Профилирование PyTorch показывает, что маскировка на месте устраняет копирование памяти и диспетчеризацию SDPA в оптимизированные бэкенды
В этой статье демонстрируется профилирование механизмов внимания в PyTorch с использованием трассировок профилировщика для выявления узких мест производительности и возможностей оптимизации. Сравниваются наивные реализации внимания со встроенной реализацией Scaled Dot Product Attention (SDPA) от PyTorch для иллюстрации поведения ядер.