Le projet llama.cpp a publié la version b10202, introduisant une optimisation SYCL qui fusionne les opérations RMS_NORM et MUL.

Cette mise à jour fournit des binaires précompilés pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Windows et Android. Elle prend en charge divers backends matériels, notamment CUDA 12/13, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16, HIP et OpenCL Adreno.

La publication inclut également l'interface utilisateur standard de llama.cpp et note que le support de KleidiAI pour macOS Apple Silicon est actuellement désactivé.