El proyecto llama.cpp ha lanzado la versión b11122, que incluye actualizaciones significativas para el backend SYCL. El lanzamiento extiende la fusión MMVQ GLU para soportar tipos de cuantización mixtos e introduce nuevas fusiones para las operaciones rms_norm+scale y ssm_conv+silu.

  • Extiende la fusión MMVQ GLU para manejar tipos de cuantización mixtos en el backend SYCL.
  • Añade fusiones rms_norm+scale y ssm_conv+silu para SYCL.
  • Corrige problemas de espaciado y convierte una macro a una función plantilla.
  • Proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de backends CPU, GPU y NPU incluyendo CUDA, Vulkan, ROCm y OpenVINO.

Esta actualización mejora el rendimiento y la compatibilidad para la aceleración de hardware basada en SYCL dentro del ecosistema llama.cpp.