Проект llama.cpp выпустил версию b10705, которая включает улучшение механизма обработки TENSOR_READ_LAZY. Это обновление принудительно загружает ленивые тензоры на CPU при включенной настройке.
- Улучшена обработка TENSOR_READ_LAZY в llama.cpp
- Принудительное поведение ленивых тензоров на CPU при активном режиме lazy
Этот релиз предоставляет обновленные бинарные файлы для macOS, Linux, Windows, Android и iOS для различных аппаратных бэкендов, включая CPU, CUDA, ROCm, Vulkan и OpenVINO.