El proyecto llama.cpp lanzó la versión b11195, introduciendo una implementación de multiplicación de matrices en mosaico para k-quants en el backend de CPU. Este cambio desempaqueta los datos cuantizados en mosaicos int8 de 256x256 y calcula los resultados utilizando microkernels para mejorar el rendimiento en operaciones de matrices grandes.

  • mul_mat en mosaico proporciona una mejora de velocidad de 3-6x para multiplicaciones de matrices grandes, con un punto de equilibrio en dimensiones de 4096x64 * 64x4096.
  • Las tasas de error permanecen triviales, con errores máximos alrededor de 1-e04 y RMSE alrededor de 1-e05.
  • La actualización incluye correcciones para compilaciones de ARM y Windows, soporte unificado de IQP para los benchmarks Q5_K e IQ4_XS, y kernels AVX2 optimizados.

La actualización mejora la velocidad de inferencia para operaciones de matrices grandes mientras mantiene la precisión numérica en las plataformas compatibles.