Выпуск llama.cpp b11095 представляет новую реализацию GATED_DELTA_NET (GDN), оптимизированную для HMX, а также различные оптимизации для ядер Hexagon и Flash Attention.

  • Поддержка GDN включает конвейеризацию, потоки HVX и векторные операции для повышения производительности на чипах Qualcomm.
  • Обновления Flash Attention сокращают чтение DDR на 20-30% во время генерации токенов за счет накопления в регистрах и улучшения конвейера DMA.
  • Выпуск предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, ROCm, Vulkan и OpenVINO.

Это обновление повышает эффективность вывода на конкретных аппаратных архитектурах, сохраняя широкую совместимость с существующими средами развертывания.