O projeto llama.cpp lançou a versão b10643, introduzindo suporte para dispositivos multi-NPU (IQ9, IQ10) e um backend totalmente assíncrono para a arquitetura Hexagon.
- O backend do Hexagon agora usa buffers não-host por padrão e implementa asincronicidade completa.
- Suporte para a plataforma Snapdragon Android 34 é adicionado.
- A quantização Q8_0 ganha suporte para desquantizadores in-place, pipelines DMA e operações de linha.
- Operações ALLREDUCE são otimizadas com kernels fundidos e eficiência de DMA aprimorada.
- Tokens de sincronização e mecanismos de fence são aprimorados para sincronizar dispositivos NPU entre divisões assíncronas.
Essas alterações permitem inferência eficiente em hardware Snapdragon multi-NPU, permitindo execução concorrente de dispositivos e cópias de tensores mais rápidas.