llama.cpp プロジェクトはバージョン b11203 をリリースし、CUDA Fast Walsh-Hadamard Transform (FWHT) の変更を含み、F16 入力を接受するようになりました。以前、CUDA FWHT は F32 入力のみを受け付けていましたが、この更新によりソース型がテンプレートパラメータになり、カーネルは変換されたコピーを必要とせずに F16 ソースを直接読み取ります。

実装により、`supports_op` とディスパッチ呼び出しが連続性と形状の条件をチェックする単一の述語を共有し、不一致がアサート失敗を引き起こす可能性のあるギャップが閉じられました。A10 GPU での test-backend-ops は、既存の F32 ケース alongside 6 つの新しい F16 Hadamard ケースを含むすべての 1297 の MUL_MAT テストに合格しました。

このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL、および Snapdragon バックエンド向けに macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されます。