El proyecto llama.cpp lanzó la compilación b10545, que aborda un error crítico en el kernel de multiplicación de matrices de la API de tensores del backend Metal. La actualización previene comportamiento indefinido y resultados corruptos al procesar tensores donde la dimensión K no es múltiplo de 32.

  • La operación matmul2d ahora usa dynamic_extent para K en lugar de un tamaño de bloque estático.
  • Las vistas de tensores de operandos se recortan al rango K válido restante en cada iteración.
  • Este cambio elimina las lecturas fuera de límites que anteriormente causaban valores NaN o corrupción de datos.
  • Se agregaron casos de prueba para ejercitar la ruta con K no alineado y verificar la corrección.

Esta corrección garantiza estabilidad numérica para modelos con dimensiones de matriz no alineadas en dispositivos Apple Silicon, previniendo errores silenciosos durante la inferencia.