Le projet llama.cpp a publié la compilation b10721, qui inclut une correction critique pour le backend WebGPU et étend la prise en charge du matériel sous Windows.

  • Corrige un plantage dans l'implémentation `ggml_backend_tensor_get()` de WebGPU lorsque le décalage n'est pas un multiple de 4.
  • Ajoute un support en aperçu pour Windows arm64 avec CUDA 13.4.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android et Windows sur divers backends CPU et GPU.

Cette version garantit la stabilité pour les utilisateurs de WebGPU avec des décalages mémoire non alignés et étend la compatibilité aux nouvelles architectures CUDA sous Windows.