UltraQuant обеспечивает 4-битное кэширование KV для агентов с большим контекстом, снижая время до первого токена на 3,47 раза в поздних раундах и увеличивая пропускную способность вывода на 1,63 раза по сравнению с базовым вариантом FP8 KV. Для достижения этого используется FP8 запросы, FP4 тензоры KV, масштабы группы UE8M0, а также встроенная операция scaled-MFMA на GPU AMD CDNA4, с оптимизациями для ядер декодирования-внимания и надежными выборами, такими как асимметричное обращение K/V и вращение по Walsh-Hadamard.
UltraQuant: 4-бит кэширование KV для агентов с большим контекстом
UltraQuant: 4-битное кэширование KV для агентов с большим контекстом
UltraQuant представляет метод 4-битного кэширования KV, разработанный специально для рабочих нагрузок агентов с большим контекстом. Он обеспечивает сокращение времени до первого токена на поздних этапах на 3,47 раза и увеличение пропускной способности вывода на 1,63 раза по сравнению с кэшированием KV в формате FP8, используя запросы в формате FP8, тензоры KV в формате FP4 и поддержку native AMD CDNA4 scaled-MFMA.
Устранение проблемы с длительными контекстами при декодировании на Radeon R9700 с использованием vLLM 0.22.1
Проблема с производительностью при длительных контекстах на AMD Radeon AI PRO R9700 (RDNA4) была решена в vLLM 0.22.1 путем включения AITER Unified Attention. Исправление включает ослабление гейта CDNA для включения RDNA4, отключение других реализаций внимания и использование KV-кэша в формате bf16, что обеспечивает значительное ускорение при всех длинах контекста. Использование FP8 на этом оборудовании неэффективно, а нативный контекст модели в размере 262K полностью достижим при использовании bf16, обеспечивая ~2.9× параллелизм без необходимости использования FP8.
Капсулы состояния выполнения для низкозадержанного выполнения ИИ на устройстве
Капсулы состояния выполнения позволяют производить контрольные точки и восстановление полного состояния выполнения графа, включая состояния КВ, рекуррентные и конволюционные, что обеспечивает низкую задержку и эффективное выполнение небольших пакетов на устройстве для ИИ. На RTX 5090 и Jetson AGX Thor восстановление капсулы обеспечивает точность на уровне байтов и идентичности токенов, с операциями на GPU менее миллисекунды и ускорением TTFT до 27x при 16k токенах, что демонстрирует значительное снижение задержки в интерактивных рабочих процессах ИИ.
Профилирование PyTorch показывает, что маскировка на месте устраняет копирование памяти и диспетчеризацию SDPA в оптимизированные бэкенды
В этой статье демонстрируется профилирование механизмов внимания в PyTorch с использованием трассировок профилировщика для выявления узких мест производительности и возможностей оптимизации. Сравниваются наивные реализации внимания со встроенной реализацией Scaled Dot Product Attention (SDPA) от PyTorch для иллюстрации поведения ядер.
FoMoE преодолевает порог полных копий с помощью разделенных экспертных слоев
FoMoE представляет систему, которая распределяет экспертные слои между рабочими узлами, чтобы избежать полных копий модели, снижая затраты на коммуникацию на 1,42 раза по сравнению с базовыми вариантами и на 45,44 раза по сравнению с DDP. Система достигает увеличения производительности до 1,4 раза за счёт механизма пропуска токенов и демонстрирует стабильную маршрутизацию, с прогнозируемыми преимуществами, распространяющимися на модели масштаба 100B, за счёт системного моделирования.