Le projet llama.cpp a publié la compilation b10656, qui inclut une modification visant à limiter la taille de la mémoire de travail. Cette modification est conçue pour empêcher le chargement de gros tenseurs dans la RAM du système.

  • La release fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Android, Windows et openEuler.
  • Les backends pris en charge incluent CPU, Vulkan, ROCm 7.14, OpenVINO, SYCL, CUDA 12/13 et OpenCL Adreno.
  • Le support de KleidiAI pour macOS Apple Silicon est désactivé dans cette compilation.

Cette mise à jour assure une utilisation de la mémoire plus stable lors des processus de quantification en limitant l'empreinte de la mémoire de travail.