O projeto llama.cpp lançou a versão b10705, que inclui uma melhoria no mecanismo de tratamento de TENSOR_READ_LAZY. Esta atualização força tensores preguiçosos na CPU quando a configuração preguiçosa está habilitada.

  • Tratamento melhorado de TENSOR_READ_LAZY no llama.cpp
  • Comportamento forçado de tensor preguiçoso na CPU quando o modo preguiçoso está ativo

Este lançamento fornece binários atualizados para macOS, Linux, Windows, Android e iOS em vários backends de hardware, incluindo CPU, CUDA, ROCm, Vulkan e OpenVINO.