Le projet llama.cpp a publié la version b10643, introduisant le support pour les appareils multi-NPU (IQ9, IQ10) et un backend entièrement asynchrone pour l'architecture Hexagon.

  • Le backend Hexagon utilise désormais par défaut des tampons non-hôte et implémente une asynchronie complète.
  • Le support pour la plateforme Snapdragon Android 34 est ajouté.
  • La quantisation Q8_0 gagne en support pour les déquantiseurs in-place, les pipelines DMA et les opérations par ligne.
  • Les opérations ALLREDUCE sont optimisées avec des noyaux fusionnés et une efficacité DMA améliorée.
  • Les mécanismes de jetons de synchronisation et de barrières (fence) sont améliorés pour synchroniser les appareils NPU entre les divisions asynchrones.

Ces modifications permettent une inférence efficace sur le matériel Snapdragon multi-NPU en permettant l'exécution concurrente des appareils et des copies de tenseurs plus rapides.