Le projet llama.cpp a publié la compilation b10639, qui inclut une correction pour le backend Vulkan où les warptiles supposaient précédemment que les tailles de warp étaient inférieures ou égales à 64. Ce changement limite la taille du warp pour contourner les problèmes avec des warps plus grands.
La version fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenCL, OpenVINO, SYCL, ROCm) et openEuler. Elle inclut également l'interface llama.cpp UI.
Cette mise à jour assure la compatibilité avec les configurations matérielles utilisant des tailles de warp supérieures à 64.