Le projet llama.cpp a publié la version b10723, qui inclut des optimisations spécifiques pour OpenCL sur le matériel graphique Intel Xe-LP. La mise à jour se concentre sur l'amélioration des performances de génération de tenseurs (TG) et de pré-remplissage (PP) en ajustant les noyaux de quantification.

  • Les opérations mul_mv Q4_K et Q5_K ont été ajustées pour augmenter les valeurs N_DST, permettant une réutilisation 2x des activations sur les appareils Intel.
  • Des configurations de tuiles 8x8 ont été implémentées pour les opérations mul_mm Q4_K et Q5_K spécifiquement pour les architectures Intel.
  • La valeur N_DST a été augmentée de 8 à 16 pour mul_mv Q4_K afin d'optimiser davantage la gestion des données.

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers backends incluant CUDA, Vulkan, ROCm et SYCL.