El proyecto llama.cpp lanzó la compilación b10777, que incluye optimizaciones al backend SYCL para multiplicación matriz-vector (MMVQ) de múltiples columnas con Q4_K. La actualización se centra en reducir el trabajo computacional redundante mediante estrategias de desempaquetado de pesos y reutilización de activaciones.

  • Optimiza el desempaquetado de pesos Q4_K y reutiliza datos entre columnas destino.
  • Implementa la reutilización de subgrupos de activaciones para valores pequeños de N (N=2..4) en dos filas de salida.
  • Limita el patrón de reutilización de dos filas específicamente para N=2 para mejorar la eficiencia.
  • Actualiza el umbral del número mágico a Q4_K_MMVQ_ROW_PAIR_MIN_NROWS=6272 y añade pruebas de rendimiento para cobertura MUL_MAT con Q4_K.

Esta versión proporciona binarios precompilados para macOS, Linux, Android, Windows y openEuler en varios backends de hardware, incluyendo CPU, CUDA, ROCm, Vulkan, OpenVINO y SYCL.