O projeto llama.cpp lançou a versão b11035, introduzindo suporte para kernels de multiplicação de matrizes IQ3_S MMQ em seu backend Vulkan.

  • A atualização inclui novos kernels IQ3_S MMQ matmul para Vulkan.
  • Block_a_to_shmem agora realiza carregamentos de 2 bytes para otimizar o acesso à memória.
  • As verificações de alinhamento foram ajustadas, pois IQ3_S utiliza o tamanho do tile K.
  • Os binários estão disponíveis para macOS, Linux, Windows, Android e openEuler nas plataformas CPU, CUDA, ROCm, OpenVINO, SYCL e OpenCL.

Este lançamento fornece binários atualizados para vários sistemas operacionais e aceleradores de hardware, permitindo que os usuários aproveitem o novo suporte à quantização Vulkan.