Проект llama.cpp выпустил сборку b11272, включающую оптимизации для бэкенда Hexagon. Основное изменение сосредоточено на оптимизации операции конкатенации для повышения производительности на оборудовании Qualcomm Snapdragon.
- Уменьшено количество пакетов в горячем цикле gather/transpose за счёт прямой сборки в целевой буфер и использования специальной инструкции для синхронизации gather.
- Вызовы программного деления заменены на fastdiv для более быстрого вычисления.
- Оптимизирован конвейер DMA-HVX и добавлены вспомогательные функции транспонирования для операции конкатенации Hexagon.
Это обновление предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для различных CPU, GPU и NPU бэкендов.