Le projet llama.cpp a publié la version b10833, introduisant des optimisations du backend Vulkan qui fusionnent des opérations de normalisation spécifiques pour améliorer les performances d'inférence.
- Prise en charge de la fusion RMS_NORM + MUL + ADD (+ MUL) et RMS_NORM + VIEW + SET_ROWS dans le backend Vulkan.
- Extension de ROPE + VIEW + SET_ROWS pour prendre en charge IMROPE.
- L'auteur signale un gain de performance d'environ 4% sur les modèles gemma4 sur son système.
Cette mise à jour offre aux utilisateurs des vitesses d'inférence plus rapides pour les modèles compatibles fonctionnant sur du matériel compatible Vulkan.