El proyecto llama.cpp lanzó la compilación b11282, que incluye una corrección para definir la macro `CUDA_ARCH` para los pases de dispositivo MUSA. Anteriormente, el encabezado del proveedor MUSA no definía esta variable, lo que hacía que las pruebas de arquitectura en las fuentes compartidas ggml-cuda se evaluaran a cero y resultaran en cuerpos de kernel vacíos.

  • La corrección informa la arquitectura más reciente similar al backend HIP mientras excluye explícitamente las funciones solo para NVIDIA incompatibles con MUSA.
  • `CUDA_ARCH` ahora se define solo para pases de dispositivo para alinearse con la lógica de detección de CUB y el comportamiento de nvcc.
  • Se eliminaron las comprobaciones redundantes `defined(CUDA_ARCH)` en las comparaciones de arquitectura ya que la macro no está definida en los pases de host para CUDA y MUSA.

Este cambio asegura que los cuerpos de kernel condicionados por arquitectura, como el kernel de desquantización q8_0 -> f16, se compilen correctamente para dispositivos MUSA en lugar de expandirse a cuerpos vacíos.