La versión b10677 de llama.cpp aborda un error crítico en el backend de Vulkan donde la falta de dependencias de vista-alias provocaba que el optimizador del gráfico reordenara los nodos incorrectamente.

  • La corrección asegura que `is_src_of` trate correctamente dos vistas de un mismo tensor como dependientes, evitando errores silenciosos durante la decodificación codiciosa y la decodificación especulativa.
  • Los nodos con operaciones como NONE, RESHAPE, TRANSPOSE, VIEW o PERMUTE ya no se tratan como dependencias de alias, restaurando la libertad del optimizador sin comprometer la corrección.
  • El código compila al hacer el parámetro lambda const y capturar `is_empty` en `is_src_of`, resolviendo problemas de visibilidad con punteros no constantes.
  • Este cambio corrige específicamente problemas de estado recurrente para modelos como Qwen3.8 en hardware Vulkan de AMD y NVIDIA, mientras que CUDA permanece sin afectar.

La versión resuelve el problema #27805 y proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de CPU, GPU y varios backends de aceleradores.