Le projet llama.cpp a publié la compilation b10921, qui inclut une correction pour WebGPU en alignant les liaisons de tenseurs sur la taille du bloc de type. Ce changement garantit que les vues quantifiées par bloc reçoivent un décalage d'élément valide dans le shader en parcourant le décalage de liaison vers l'arrière jusqu'à ce que la distance au tenseur soit un nombre entier de blocs.

La version fournit des binaires et des frameworks pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu avec les backends CPU, Vulkan, ROCm, OpenVINO et SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL et ROCm) et openEuler.

Cette mise à jour assure un traitement correct des tenseurs dans les shaders WebGPU tout en maintenant la prise en charge d'un large éventail d'architectures matérielles et d'implémentations de backend.