El proyecto llama.cpp lanzó la compilación b10353, que aborda un error crítico en la operación ggml_roll en los backends de CUDA y Metal. Anteriormente, los tensores fuente permutados (no contiguos) producían resultados incorrectos silenciosamente porque estos backends ignoraban la información de paso.

  • La corrección añade un requisito de fuente contigua a ambos kernels roll de CUDA y Metal, coincidiendo con la protección GGML_OP_ROPE existente.
  • Este cambio asegura que el programador vuelva a la implementación de CPU para entradas no contiguas, que maneja correctamente los pasos.
  • Se añadió un caso de prueba test_roll permutado para verificar la corrección.

Esta actualización previene la corrupción de datos en modelos que dependen de operaciones ROLL con layouts de memoria no estándar.