llama.cpp プロジェクトはビルド b11282 をリリースし、MUSA デバイスパスに対して `CUDA_ARCH` マクロを定義する修正を含んでいます。以前は、MUSA ベンダーヘッダーがこの変数を定義しておらず、共有の ggml-cuda ソース内のアーキテクチャテストがゼロに評価され、空のカーネルボディになる原因となっていました。
- 修正により、HIP バックエンドと同様に最新のアーキテクチャが報告され、MUSA と互換性のない NVIDIA のみの機能が明示的に除外されます。
- `CUDA_ARCH` は now、CUB の検出ロジックと nvcc の動作に合わせて、デバイスパスに対してのみ定義されるようになりました。
- CUDA および MUSA のホストパスではマクロが未定義であるため、アーキテクチャ比較における冗長な `defined(CUDA_ARCH)` チェックが削除されました。
この変更により、q8_0 -> f16 除量子化カーネルなど、アーキテクチャにゲートされたカーネルボディが、空のボディに展開されるのではなく、MUSA デバイスに対して正しくコンパイルされることが保証されます。