O projeto llama.cpp lançou a versão b10202, introduzindo uma otimização SYCL que funde as operações RMS_NORM e MUL.

Esta atualização fornece binários pré-compilados para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Windows e Android. Suporta vários backends de hardware, incluindo CUDA 12/13, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16, HIP e OpenCL Adreno.

O lançamento também inclui a interface de usuário padrão do llama.cpp e observa que o suporte do KleidiAI para macOS Apple Silicon está atualmente desabilitado.