O projeto llama.cpp lançou a versão b11035, introduzindo suporte para kernels de multiplicação de matrizes IQ3_S MMQ em seu backend Vulkan.
- A atualização inclui novos kernels IQ3_S MMQ matmul para Vulkan.
- Block_a_to_shmem agora realiza carregamentos de 2 bytes para otimizar o acesso à memória.
- As verificações de alinhamento foram ajustadas, pois IQ3_S utiliza o tamanho do tile K.
- Os binários estão disponíveis para macOS, Linux, Windows, Android e openEuler nas plataformas CPU, CUDA, ROCm, OpenVINO, SYCL e OpenCL.
Este lançamento fornece binários atualizados para vários sistemas operacionais e aceleradores de hardware, permitindo que os usuários aproveitem o novo suporte à quantização Vulkan.