La version llama.cpp b11095 introduit une nouvelle implémentation de GATED_DELTA_NET (GDN) optimisée pour HMX, ainsi que diverses optimisations pour les noyaux Hexagon et Flash Attention.

  • La prise en charge de GDN comprend le pipeline, le multithreading HVX et les opérations vectorisées pour améliorer les performances sur les puces Qualcomm.
  • Les mises à jour de Flash Attention réduisent les lectures DDR de 20 à 30 % lors de la génération de tokens grâce à l'accumulation dans les registres et aux améliorations du pipeline DMA.
  • La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, ROCm, Vulkan et OpenVINO.

Cette mise à jour améliore l'efficacité de l'inférence sur des architectures matérielles spécifiques tout en maintenant une large compatibilité avec les environnements de déploiement existants.