El proyecto llama.cpp lanzó la versión b10908, que incluye una corrección para hilos inactivos en los núcleos iq mul_mv restantes para ne00 < 1024. Este cambio generaliza la lógica de división de filas a seis núcleos específicos: iq1_s, iq1_m, iq2_xxs, iq2_xs, iq2_s e iq3_s.

  • La corrección aborda casos donde las filas tienen menos de 32 fragmentos, permitiendo que los hilos compartan fragmentos y tomen porciones de las filas.
  • Desplaza el puntero de fila src0 una vez en los núcleos iq mul_mv ya que q2, dh, sc, qh y signos se derivan de xr.
  • La implementación combina la división de filas iq mul_mv con offset0 para mantener x y sus punteros derivados en la ruta existente.

Este lanzamiento proporciona binarios para macOS, Linux, Android, Windows y openEuler a través de varias arquitecturas incluyendo CPU, CUDA, ROCm, Vulkan y SYCL.