La versión llama.cpp b11224 aborda los resultados de cálculo incorrectos en el backend de Vulkan cuando las operaciones de multiplicación de matrices leen fragmentos de tensores más grandes y estraidos, como los cachés KV.

  • El paso del lote para los tensores src0 y src1 in situ ahora se deriva correctamente de nb[2] en lugar de ne00*ne01, asegurando el acceso correcto a las filas en todas las cabezas.
  • Los rangos A y B in situ se dimensionan por su extensión estraida usando ggml_nbytes o ggml_vk_subbuffer para evitar leer datos borrados o colgarse en hardware NVIDIA sin coopmat2.
  • Las rutas mul_mat_id y mul_mm se actualizan para manejar correctamente las vistas de expertos estraidas y los mosaicos parciales, evitando bloqueos en operaciones NVFP4.

Esta corrección garantiza resultados de inferencia precisos para mecanismos de autoatención del decodificador que dependen de diseños de memoria estraidos en el backend de Vulkan.