Le projet llama.cpp a publié la compilation b11272, qui inclut des optimisations pour le backend Hexagon. Le changement principal se concentre sur l'optimisation de l'opération de concaténation pour améliorer les performances sur le matériel Qualcomm Snapdragon.

  • Réduction des paquets dans la boucle critique gather/transpose en collectant directement dans le tampon de destination et en utilisant une instruction spéciale pour la synchronisation gather.
  • Remplacement des appels de division logicielle par fastdiv pour un calcul plus rapide.
  • Optimisation du pipeline DMA-HVX et ajout d'helpers de transposition pour l'opération de concaténation Hexagon.

Cette mise à jour fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur divers backends CPU, GPU et NPU.