llama.cpp プロジェクトはバージョン b10099 をリリースし、NVFP4 W4A4 アクティベーション量子化の改善のために CUDA バックエンドに重要な更新が含まれています。

  • より良いパフォーマンスのための融合されたチャンネルごとの amax および量子化カーネル。
  • NVIDIA ハードウェアで利用可能な場合、nvfp4x4 固有命令のサポートを追加。
  • 固有命令によるスケール検索の最適化とブロックごとの amax 計算の復元。
  • オーバーヘッドを削減するための 32 バイト読み込みおよびポインタ演算の最適化を実装。
  • HIP の互換性問題に注意し、builtin_align(32) 構造体の使用を NVIDIA に限定して保護。

このリリースでは、CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL およびその他のバックエンド向けに、macOS、Linux、Windows、Android、openEuler 用の更新されたバイナリが提供されています。