llama.cpp プロジェクトはバージョン b10330 をリリースし、rms_norm、乗算、RoPE の操作を単一のカーネルに融合する CUDA 最適化を導入しました。この変更には、融合された操作のメモリ範囲チェックと、ブロードキャスト重みのための新しいテストケースが伴います。
- CUDA: rms_norm + mul + rope (+ view + set_rows) を融合
- tests: rms_norm_mul_rope にブロードキャスト重みケースを追加
- CUDA: rms_norm rope 融合前にメモリ範囲をチェック
- CUDA: rope set_rows 融合中のメモリ範囲をチェック
このリリースでは、CPU、Vulkan、ROCm、OpenVINO、SYCL、HIP を含むさまざまなハードウェアバックエンド向けに、macOS、Linux、Windows、Android、iOS 用のバイナリが提供されます。