Проект llama.cpp выпустил сборку b11282, которая включает исправление для определения макроса `CUDA_ARCH` для проходов устройства MUSA. Ранее заголовок поставщика MUSA не определял эту переменную, из-за чего тесты архитектуры в общих исходных кодах ggml-cuda давали ноль и приводили к пустым телам ядер.

  • Исправление сообщает о новейшей архитектуре аналогично бэкенду HIP, явно исключая функции только для NVIDIA, несовместимые с MUSA.
  • `CUDA_ARCH` теперь определяется только для проходов устройства, чтобы соответствовать логике обнаружения CUB и поведению nvcc.
  • Избыточные проверки `defined(CUDA_ARCH)` в сравнениях архитектуры были удалены, поскольку макрос не определен в хост-проходах для CUDA и MUSA.

Это изменение гарантирует, что тела ядер, управляемые архитектурой, такие как ядро деквантования q8_0 -> f16, правильно компилируются для устройств MUSA вместо расширения до пустых тел.