Le projet llama.cpp a publié la version b10833, introduisant des optimisations du backend Vulkan qui fusionnent des opérations de normalisation spécifiques pour améliorer les performances d'inférence.

  • Prise en charge de la fusion RMS_NORM + MUL + ADD (+ MUL) et RMS_NORM + VIEW + SET_ROWS dans le backend Vulkan.
  • Extension de ROPE + VIEW + SET_ROWS pour prendre en charge IMROPE.
  • L'auteur signale un gain de performance d'environ 4% sur les modèles gemma4 sur son système.

Cette mise à jour offre aux utilisateurs des vitesses d'inférence plus rapides pour les modèles compatibles fonctionnant sur du matériel compatible Vulkan.