El proyecto llama.cpp lanzó la compilación b11272, que incluye optimizaciones para el backend Hexagon. El cambio principal se centra en optimizar la operación de concatenación para mejorar el rendimiento en hardware Qualcomm Snapdragon.

  • Reducción de paquetes en el bucle crítico de gather/transpose al recopilar directamente en el búfer de destino y usar una instrucción especial para la sincronización de gather.
  • Reemplazo de llamadas de división por software con fastdiv para un cálculo más rápido.
  • Optimización del pipeline DMA-HVX y adición de ayudantes de transposición para la operación de concatenación Hexagon.

Esta actualización proporciona binarios para macOS, Linux, Windows, Android y openEuler en varios backends de CPU, GPU y NPU.