Le projet llama.cpp a publié la version b10670, qui comprend une optimisation spécifique pour l'architecture Xe2 d'Intel. La mise à jour dirige l'opération de décodage des clés et valeurs (KV) quantisées exclusivement vers le backend TILE pour le matériel BMG, tout en conservant le backend VEC sur les autres architectures jusqu'à leur validation.
- Le décodage KV quantisé est désormais dirigé vers TILE sur Xe2 (BMG).
- Les autres architectures continuent d'utiliser le backend VEC en attente de validation.
- Des binaires sont fournis pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm 7.14, OpenVINO, SYCL FP32/FP16), Android, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 7.14) et openEuler.
Ce changement optimise les modèles d'accès à la mémoire pour des générations spécifiques de matériel Intel.