O projeto llama.cpp lançou a compilação b10653, introduzindo o recurso TENSOR_READ_LAZY em seu carregador de modelos. Esta alteração inclui a adição da função TENSOR_GET_ROW_LAZY e uma flag correspondente --tensor-read-lazy na linha de comando.
- Adicionados TENSOR_READ_LAZY e TENSOR_GET_ROW_LAZY ao carregador de modelos.
- Introduzida a opção CLI --tensor-read-lazy para habilitar a leitura preguiçosa de tensores.
- Fornecidos binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e iOS.
Esta versão atualiza a biblioteca principal com novas capacidades de carregamento lento enquanto distribui binários pré-compilados através das plataformas suportadas.