Проект llama.cpp выпустил версию b10643, добавившую поддержку устройств с несколькими NPU (IQ9, IQ10) и полностью асинхронный бэкенд для архитектуры Hexagon.

  • Бэкенд Hexagon теперь по умолчанию использует нехостовые буферы и реализует полную асинхронность.
  • Добавлена поддержка платформы Snapdragon Android 34.
  • Квантование Q8_0 получило поддержку инлайн-деquantизаторов, конвейеров DMA и операций с строками.
  • Операции ALLREDUCE оптимизированы с помощью слитых ядер и улучшенной эффективности DMA.
  • Механизмы синхронизации токенов и заборов (fence) улучшены для синхронизации устройств NPU между асинхронными разделениями.

Эти изменения обеспечивают эффективный вывод на аппаратном обеспечении Snapdragon с несколькими NPU, позволяя параллельное выполнение устройств и более быстрые копии тензоров.