O projeto llama.cpp lançou a versão b10203, que introduz suporte ao formato de quantização q2_0 em operações de multiplicação de matrizes baseadas em SYCL. Esta atualização expande a compatibilidade da biblioteca para cenários específicos de aceleração por hardware.
- Adiciona suporte para q2_0 em mul_mat via PR #26231.
- Estende a cobertura para casos adicionais de q2_0 dentro do backend SYCL.
- Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) e openEuler.
O lançamento permite que os usuários utilizem a quantização q2_0 em dispositivos compatíveis com SYCL, ampliando o intervalo de configurações de hardware suportadas para inferência de modelos eficiente.