O projeto llama.cpp lançou a compilação b11282, que inclui uma correção para definir a macro `CUDA_ARCH` para os passes de dispositivo MUSA. Anteriormente, o cabeçalho do fornecedor MUSA não definia essa variável, fazendo com que os testes de arquitetura nas fontes ggml-cuda compartilhadas avaliassem zero e resultassem em corpos de kernel vazios.

  • A correção relata a arquitetura mais recente semelhante ao backend HIP enquanto exclui explicitamente recursos apenas para NVIDIA incompatíveis com MUSA.
  • `CUDA_ARCH` agora é definido apenas para passes de dispositivo para alinhar-se com a lógica de detecção do CUB e o comportamento do nvcc.
  • Verificações redundantes `defined(CUDA_ARCH)` nas comparações de arquitetura foram removidas, pois a macro não está definida nos passes de host para CUDA e MUSA.

Esta alteração garante que os corpos de kernel condicionados por arquitetura, como o kernel de desquantização q8_0 -> f16, sejam compilados corretamente para dispositivos MUSA em vez de se expandirem para corpos vazios.