Le projet llama.cpp a publié la version b11309, qui comprend une optimisation clé pour le backend Hexagon. Cette mise à jour ajoute le support du mode scatter sécurisé à l'opération ALLREDUCE, visant à améliorer les performances et la stabilité sur les appareils Qualcomm Snapdragon.
- Optimise ALLREDUCE de Hexagon en ajoutant le support du mode scatter sécurisé.
- Réécrit l'implémentation hex-allreduce pour supprimer les débordements de registres.
- Réduit les commentaires excessifs dans le code hex-allreduce.
- Fournit des binaires pour macOS (Apple Silicon et Intel), Linux, Windows, Android et openEuler via les backends CPU, GPU et NPU.
Cette version permet une inférence distribuée plus efficace sur le matériel mobile avec les NPUs Hexagon tout en maintenant une large compatibilité entre les principaux systèmes d'exploitation de bureau et mobiles.