O projeto llama.cpp lançou a compilação b10721, que inclui uma correção crítica para o backend do WebGPU e amplia o suporte de hardware no Windows.

  • Corrige uma falha na implementação `ggml_backend_tensor_get()` do WebGPU quando o deslocamento não é múltiplo de 4.
  • Adiciona suporte preliminar para Windows arm64 com CUDA 13.4.
  • Fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android e Windows em vários backends de CPU e GPU.

Esta versão garante estabilidade para usuários do WebGPU com deslocamentos de memória não alinhados e estende a compatibilidade para novas arquiteturas CUDA no Windows.