Проект llama.cpp выпустил сборку b11272, включающую оптимизации для бэкенда Hexagon. Основное изменение сосредоточено на оптимизации операции конкатенации для повышения производительности на оборудовании Qualcomm Snapdragon.

  • Уменьшено количество пакетов в горячем цикле gather/transpose за счёт прямой сборки в целевой буфер и использования специальной инструкции для синхронизации gather.
  • Вызовы программного деления заменены на fastdiv для более быстрого вычисления.
  • Оптимизирован конвейер DMA-HVX и добавлены вспомогательные функции транспонирования для операции конкатенации Hexagon.

Это обновление предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для различных CPU, GPU и NPU бэкендов.