O projeto llama.cpp lançou a compilação b10693, que introduz suporte para NPUs Qualcomm Hexagon. Esta atualização permite a descoberta em tempo de execução dos núcleos NPU disponíveis e possibilita a criação de sessões de inferência sob demanda.

  • Adicionadas interfaces de alocação e limpeza preguiçosa de sessões para dispositivos Hexagon.
  • Implementada a descoberta em tempo de execução dos núcleos NPU disponíveis.
  • Configurado o rejeição antecipada de dispositivos inexistentes durante a inicialização.
  • Fornecidos binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, Vulkan, ROCm, OpenVINO, SYCL e CUDA.