Le projet llama.cpp a publié la version b10705, qui inclut une amélioration du mécanisme de gestion de TENSOR_READ_LAZY. Cette mise à jour force les tenseurs paresseux sur le CPU lorsque le paramètre paresseux est activé.

  • Gestion améliorée de TENSOR_READ_LAZY dans llama.cpp
  • Comportement forcé des tenseurs paresseux sur le CPU lorsque le mode paresseux est actif

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et iOS sur divers backends matériels incluant CPU, CUDA, ROCm, Vulkan et OpenVINO.