Le projet llama.cpp a publié la compilation b10653, introduisant la fonctionnalité TENSOR_READ_LAZY dans son chargeur de modèles. Ce changement inclut l'ajout de la fonction TENSOR_GET_ROW_LAZY et un drapeau correspondant --tensor-read-lazy en ligne de commande.

  • Ajout de TENSOR_READ_LAZY et TENSOR_GET_ROW_LAZY au chargeur de modèles.
  • Introduction de l'option CLI --tensor-read-lazy pour activer la lecture paresseuse des tenseurs.
  • Fourniture de binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et iOS.

Cette version met à jour la bibliothèque principale avec de nouvelles capacités de chargement différé tout en distribuant des binaires précompilés sur les plateformes prises en charge.