El proyecto llama.cpp ha lanzado la versión b11035, introduciendo soporte para núcleos de multiplicación de matrices IQ3_S MMQ en su backend de Vulkan.

  • La actualización incluye nuevos núcleos IQ3_S MMQ matmul para Vulkan.
  • Block_a_to_shmem ahora realiza cargas de 2 bytes para optimizar el acceso a la memoria.
  • Las comprobaciones de alineación se han ajustado ya que IQ3_S utiliza el tamaño del tile K.
  • Los binarios están disponibles para macOS, Linux, Windows, Android y openEuler en plataformas CPU, CUDA, ROCm, OpenVINO, SYCL y OpenCL.

Esta versión proporciona binarios actualizados para varios sistemas operativos y aceleradores de hardware, permitiendo a los usuarios aprovechar el nuevo soporte de cuantización de Vulkan.