Le projet llama.cpp a publié la version b10705, qui inclut une amélioration du mécanisme de gestion de TENSOR_READ_LAZY. Cette mise à jour force les tenseurs paresseux sur le CPU lorsque le paramètre paresseux est activé.
- Gestion améliorée de TENSOR_READ_LAZY dans llama.cpp
- Comportement forcé des tenseurs paresseux sur le CPU lorsque le mode paresseux est actif
Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers backends matériels incluant CPU, CUDA, ROCm, Vulkan et OpenVINO.