Проект llama.cpp выпустил сборку b10921, которая включает исправление для WebGPU путем выравнивания привязок тензоров по размеру блока типа. Это изменение гарантирует, что представления с блочным квантованием получают корректное смещение элемента в шейдере, проходя назад по смещению привязки до тех пор, пока расстояние до тензора не станет целым числом блоков.
Релиз предоставляет бинарные файлы и фреймворки для macOS (Apple Silicon и Intel), iOS, Linux (Ubuntu с CPU, Vulkan, ROCm, OpenVINO и SYCL бэкендами), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL и ROCm) и openEuler.
Это обновление обеспечивает корректную обработку тензоров в шейдерах WebGPU, сохраняя поддержку широкого спектра аппаратных архитектур и реализаций бэкендов.