O lançamento do llama.cpp b11095 introduz uma nova implementação de GATED_DELTA_NET (GDN) otimizada para HMX, juntamente com várias otimizações para os kernels Hexagon e Flash Attention.
- O suporte ao GDN inclui pipeline, encadeamento HVX e operações vetorizadas para melhorar o desempenho em chips Qualcomm.
- As atualizações do Flash Attention reduzem as leituras DDR em 20-30% durante a geração de tokens por meio de acumulação em registrador e melhorias no pipeline DMA.
- O lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, ROCm, Vulkan e OpenVINO.
Esta atualização melhora a eficiência da inferência em arquiteturas de hardware específicas, mantendo ampla compatibilidade com os ambientes de implantação existentes.