Le projet llama.cpp a publié la version b10538, introduisant une optimisation clé dans le backend metal. Cette mise à jour permet la déquantisation du cache de clés et de valeurs (KV) exclusivement pour les tailles de lot importantes.
- Le changement principal concerne le backend metal, qui applique désormais le cache KV déquantisé uniquement lors du traitement de grands lots.
- Les binaires sont disponibles pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.
Le support de KleidiAI sur Apple Silicon pour macOS et ROCm 7.14 sur Ubuntu sont désactivés dans cette version.
Cette optimisation vise à améliorer l'efficacité mémoire ou les performances pour les charges de travail impliquant de grandes tailles de lot sur du matériel compatible.