Проект llama.cpp выпустил версию b10643, добавившую поддержку устройств с несколькими NPU (IQ9, IQ10) и полностью асинхронный бэкенд для архитектуры Hexagon.
- Бэкенд Hexagon теперь по умолчанию использует нехостовые буферы и реализует полную асинхронность.
- Добавлена поддержка платформы Snapdragon Android 34.
- Квантование Q8_0 получило поддержку инлайн-деquantизаторов, конвейеров DMA и операций с строками.
- Операции ALLREDUCE оптимизированы с помощью слитых ядер и улучшенной эффективности DMA.
- Механизмы синхронизации токенов и заборов (fence) улучшены для синхронизации устройств NPU между асинхронными разделениями.
Эти изменения обеспечивают эффективный вывод на аппаратном обеспечении Snapdragon с несколькими NPU, позволяя параллельное выполнение устройств и более быстрые копии тензоров.