El proyecto llama.cpp ha lanzado la compilación b10721, que incluye una corrección crítica para el backend de WebGPU y amplía el soporte de hardware en Windows.

  • Corrige un fallo en la implementación `ggml_backend_tensor_get()` de WebGPU cuando el desplazamiento no es múltiplo de 4.
  • Añade soporte preliminar para Windows arm64 con CUDA 13.4.
  • Proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android y Windows a través de varios backends de CPU y GPU.

Esta versión garantiza la estabilidad para los usuarios de WebGPU con desplazamientos de memoria no alineados y amplía la compatibilidad con nuevas arquitecturas CUDA en Windows.