llama.cpp プロジェクトはバージョン b11390 をリリースしました。これは、エキスパート数がマイクロバッチサイズより大幅に大きい場合に発生する CUDA MMQ メモリ障害の修正を含んでいます。
- Mixture-of-Experts (MMQ) 処理に関連する CUDA バックエンドのメモリ障害を解決します。
- macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Windows (CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android、および openEuler 用のバイナリを提供します。
- 更新された UI ビルドを含みます。
このアップデートは、特定のメモリアクセスエラーを防ぐことで、CUDA ハードウェア上で Mixture-of-Experts モデルを実行するユーザーの安定性を確保します。