La versión llama.cpp b11095 introduce una nueva implementación de GATED_DELTA_NET (GDN) optimizada para HMX, junto con varias optimizaciones para los núcleos Hexagon y Flash Attention.

  • El soporte de GDN incluye canalización, subprocesamiento HVX y operaciones vectorizadas para mejorar el rendimiento en chips Qualcomm.
  • Las actualizaciones de Flash Attention reducen las lecturas DDR entre un 20-30% durante la generación de tokens mediante acumulación en registros y mejoras en el canal DMA.
  • La versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, ROCm, Vulkan y OpenVINO.

Esta actualización mejora la eficiencia de inferencia en arquitecturas de hardware específicas mientras mantiene una amplia compatibilidad con los entornos de implementación existentes.