llama.cpp プロジェクトはバージョン b10099 をリリースし、NVFP4 W4A4 アクティベーション量子化の改善のために CUDA バックエンドに重要な更新が含まれています。
- より良いパフォーマンスのための融合されたチャンネルごとの amax および量子化カーネル。
- NVIDIA ハードウェアで利用可能な場合、nvfp4x4 固有命令のサポートを追加。
- 固有命令によるスケール検索の最適化とブロックごとの amax 計算の復元。
- オーバーヘッドを削減するための 32 バイト読み込みおよびポインタ演算の最適化を実装。
- HIP の互換性問題に注意し、builtin_align(32) 構造体の使用を NVIDIA に限定して保護。
このリリースでは、CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL およびその他のバックエンド向けに、macOS、Linux、Windows、Android、openEuler 用の更新されたバイナリが提供されています。