O projeto llama.cpp lançou a versão b10643, introduzindo suporte para dispositivos multi-NPU (IQ9, IQ10) e um backend totalmente assíncrono para a arquitetura Hexagon.

  • O backend do Hexagon agora usa buffers não-host por padrão e implementa asincronicidade completa.
  • Suporte para a plataforma Snapdragon Android 34 é adicionado.
  • A quantização Q8_0 ganha suporte para desquantizadores in-place, pipelines DMA e operações de linha.
  • Operações ALLREDUCE são otimizadas com kernels fundidos e eficiência de DMA aprimorada.
  • Tokens de sincronização e mecanismos de fence são aprimorados para sincronizar dispositivos NPU entre divisões assíncronas.

Essas alterações permitem inferência eficiente em hardware Snapdragon multi-NPU, permitindo execução concorrente de dispositivos e cópias de tensores mais rápidas.