O projeto llama.cpp lançou a versão b11006, introduzindo suporte para processadores Qualcomm Hexagon para lidar com formatos de K-Quantization. Esta atualização implementa kernels específicos para os níveis de quantização Q4_K e Q6_K na arquitetura Hexagon.

  • Implementação dos kernels q6k e q4k para DSPs do Hexagon.
  • Precisão de descompactação melhorada para o kernel hex-q6k.
  • Adicionado suporte para kernels Q4_K em hardware Hexagon.

O lançamento fornece binários pré-compilados para macOS, Linux, Windows, Android e openEuler através de vários backends de CPU e GPU incluindo CUDA, ROCm, Vulkan e OpenVINO.