Выпуск llama.cpp b11095 представляет новую реализацию GATED_DELTA_NET (GDN), оптимизированную для HMX, а также различные оптимизации для ядер Hexagon и Flash Attention.
- Поддержка GDN включает конвейеризацию, потоки HVX и векторные операции для повышения производительности на чипах Qualcomm.
- Обновления Flash Attention сокращают чтение DDR на 20-30% во время генерации токенов за счет накопления в регистрах и улучшения конвейера DMA.
- Выпуск предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, ROCm, Vulkan и OpenVINO.
Это обновление повышает эффективность вывода на конкретных аппаратных архитектурах, сохраняя широкую совместимость с существующими средами развертывания.