Le projet llama.cpp a publié la version b10723, qui inclut des optimisations spécifiques pour OpenCL sur le matériel graphique Intel Xe-LP. La mise à jour se concentre sur l'amélioration des performances de génération de tenseurs (TG) et de pré-remplissage (PP) en ajustant les noyaux de quantification.
- Les opérations mul_mv Q4_K et Q5_K ont été ajustées pour augmenter les valeurs N_DST, permettant une réutilisation 2x des activations sur les appareils Intel.
- Des configurations de tuiles 8x8 ont été implémentées pour les opérations mul_mm Q4_K et Q5_K spécifiquement pour les architectures Intel.
- La valeur N_DST a été augmentée de 8 à 16 pour mul_mv Q4_K afin d'optimiser davantage la gestion des données.
Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers backends incluant CUDA, Vulkan, ROCm et SYCL.