O projeto llama.cpp lançou a compilação b10921, que inclui uma correção para o WebGPU alinhando as vinculações de tensores ao tamanho do bloco do tipo. Essa alteração garante que as visualizações quantizadas por bloco recebam um deslocamento de elemento válido no shader, percorrendo o deslocamento da vinculação para trás até que a distância ao tensor seja um número inteiro de blocos.

O lançamento fornece binários e frameworks para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu com backends de CPU, Vulkan, ROCm, OpenVINO e SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL e ROCm) e openEuler.

Esta atualização garante o tratamento correto de tensores nos shaders do WebGPU, mantendo o suporte em uma ampla gama de arquiteturas de hardware e implementações de backend.