Le projet llama.cpp a publié la compilation b10758, introduisant les capacités de fusion MUL_MAT et MUL_MAT_ID pour le DSP Hexagon. Cette mise à jour comprend également plusieurs correctifs pour améliorer la stabilité et les performances sur le matériel Qualcomm.
- Fusionne les multiplications matricielles QKV et FFN qui aboutissent à HMX.
- Supprime la restriction codée en dur ne[1] < 32K.
- Corrige le dimensionnement des frais généraux pour éviter de dépasser le budget vtcm pour les grandes dimensions.
- Fusionne MUL_MAT_ID dans les variantes MUL_MAT_ID_NX lorsque cela est possible.
- Met à jour le dimensionnement de opbatch et opqueue pour réduire la surcharge d'allocation du tampon de traçage.
- Ajoute la défragmentation de l'espace d'adressage virtuel pour éviter les aborts dus à la fragmentation.
Ces modifications optimisent l'utilisation de la mémoire et l'efficacité d'exécution pour les appareils basés sur Hexagon.