O projeto llama.cpp lançou a compilação b10656, que inclui uma alteração para limitar o tamanho da memória de trabalho. Esta modificação foi projetada para impedir que tensores grandes sejam carregados na RAM do sistema.
- O lançamento fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Android, Windows e openEuler.
- Os backends suportados incluem CPU, Vulkan, ROCm 7.14, OpenVINO, SYCL, CUDA 12/13 e OpenCL Adreno.
- O suporte ao KleidiAI para macOS Apple Silicon está desativado nesta compilação.
Esta atualização garante um uso de memória mais estável durante os processos de quantização, limitando a pegada da memória de trabalho.