Проект llama.cpp выпустил сборку b10758, внедряющую возможности слияния MUL_MAT и MUL_MAT_ID для DSP Hexagon. Это обновление также включает несколько исправлений для повышения стабильности и производительности на оборудовании Qualcomm.

  • Сливает умножения матриц QKV и FFN, попадающие в HMX.
  • Убирает жёстко заданное ограничение ne[1] < 32K.
  • Корректирует размер накладных расходов, чтобы предотвратить превышение бюджета vtcm для больших измерений.
  • Сливает MUL_MAT_ID в варианты MUL_MAT_ID_NX там, где это возможно.
  • Обновляет размеры opbatch и opqueue для снижения накладных расходов на выделение буфера трассировки.
  • Добавляет дефрагментацию виртуального адресного пространства для предотвращения сбоев из-за фрагментации.

Эти изменения оптимизируют использование памяти и эффективность выполнения на устройствах на базе Hexagon.