O projeto llama.cpp lançou a compilação b10653, introduzindo o recurso TENSOR_READ_LAZY em seu carregador de modelos. Esta alteração inclui a adição da função TENSOR_GET_ROW_LAZY e uma flag correspondente --tensor-read-lazy na linha de comando.

  • Adicionados TENSOR_READ_LAZY e TENSOR_GET_ROW_LAZY ao carregador de modelos.
  • Introduzida a opção CLI --tensor-read-lazy para habilitar a leitura preguiçosa de tensores.
  • Fornecidos binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e iOS.

Esta versão atualiza a biblioteca principal com novas capacidades de carregamento lento enquanto distribui binários pré-compilados através das plataformas suportadas.