O projeto llama.cpp lançou a versão b11006, introduzindo suporte para processadores Qualcomm Hexagon para lidar com formatos de K-Quantization. Esta atualização implementa kernels específicos para os níveis de quantização Q4_K e Q6_K na arquitetura Hexagon.
- Implementação dos kernels q6k e q4k para DSPs do Hexagon.
- Precisão de descompactação melhorada para o kernel hex-q6k.
- Adicionado suporte para kernels Q4_K em hardware Hexagon.
O lançamento fornece binários pré-compilados para macOS, Linux, Windows, Android e openEuler através de vários backends de CPU e GPU incluindo CUDA, ROCm, Vulkan e OpenVINO.