O projeto llama.cpp lançou a compilação b10721, que inclui uma correção crítica para o backend do WebGPU e amplia o suporte de hardware no Windows.
- Corrige uma falha na implementação `ggml_backend_tensor_get()` do WebGPU quando o deslocamento não é múltiplo de 4.
- Adiciona suporte preliminar para Windows arm64 com CUDA 13.4.
- Fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android e Windows em vários backends de CPU e GPU.
Esta versão garante estabilidade para usuários do WebGPU com deslocamentos de memória não alinhados e estende a compatibilidade para novas arquiteturas CUDA no Windows.