Le projet llama.cpp a publié la version b10442, introduisant des optimisations Vulkan spécifiques pour le matériel Intel Xe tout en traitant les problèmes de sécurité mémoire dans les routines de multiplication de matrices.

  • Ajoute les drapeaux SHMEM_STRIDE_PAD et APPLY_SLM_A_RESHAPE pour coopmat mul_mm sur Intel Xe.
  • Corrige l'estimation de la mémoire partagée pour Intel SHMEM_STRIDE_PAD=0 dans matmul_shmem_support.
  • Implémente l'alignement de ligne de cache pour les kvalues_mxfp4 partagés afin d'améliorer la gestion des données.
  • Résout une lecture hors limites (OOB) lors de l'initialisation de kvalues_mxfp4 suite aux modifications de remplissage de ligne de cache.
  • Restreint les ajustements de remodelage SLM-A aux pilotes Windows Intel et annule le remplissage de ligne de cache mxfp4 si nécessaire.

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et openEuler via les backends CPU, Vulkan, CUDA, ROCm, OpenVINO et SYCL.