Le projet llama.cpp a publié la version b10327, qui inclut une correction pour le nombre de threads et de blocs lors des lancements du noyau de copie quantifiée sur CUDA. Cette mise à jour traite d'un problème identifié dans la pull request #26731.

  • La release ajoute des tests pour les cas de copie avec un nombre de blocs inégal afin de garantir l'exactitude.
  • Les binaires sont disponibles pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) et openEuler.
  • Un XCFramework pour iOS et une compilation UI autonome sont également fournis.

Cette release assure l'exécution stable des opérations de copie quantifiée sur le matériel CUDA sur une large gamme de plateformes prises en charge.