Проект llama.cpp выпустил сборку b10758, внедряющую возможности слияния MUL_MAT и MUL_MAT_ID для DSP Hexagon. Это обновление также включает несколько исправлений для повышения стабильности и производительности на оборудовании Qualcomm.
- Сливает умножения матриц QKV и FFN, попадающие в HMX.
- Убирает жёстко заданное ограничение ne[1] < 32K.
- Корректирует размер накладных расходов, чтобы предотвратить превышение бюджета vtcm для больших измерений.
- Сливает MUL_MAT_ID в варианты MUL_MAT_ID_NX там, где это возможно.
- Обновляет размеры opbatch и opqueue для снижения накладных расходов на выделение буфера трассировки.
- Добавляет дефрагментацию виртуального адресного пространства для предотвращения сбоев из-за фрагментации.
Эти изменения оптимизируют использование памяти и эффективность выполнения на устройствах на базе Hexagon.