La versión llama.cpp b11095 introduce una nueva implementación de GATED_DELTA_NET (GDN) optimizada para HMX, junto con varias optimizaciones para los núcleos Hexagon y Flash Attention.
- El soporte de GDN incluye canalización, subprocesamiento HVX y operaciones vectorizadas para mejorar el rendimiento en chips Qualcomm.
- Las actualizaciones de Flash Attention reducen las lecturas DDR entre un 20-30% durante la generación de tokens mediante acumulación en registros y mejoras en el canal DMA.
- La versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, ROCm, Vulkan y OpenVINO.
Esta actualización mejora la eficiencia de inferencia en arquitecturas de hardware específicas mientras mantiene una amplia compatibilidad con los entornos de implementación existentes.