Proyek llama.cpp merilis versi b11203, yang mencakup perubahan pada Transformasi Walsh-Hadamard Cepat (FWHT) CUDA untuk menerima input F16. Sebelumnya, FWHT CUDA hanya menerima input F32; pembaruan ini membuat tipe sumber menjadi parameter template sehingga kernel membaca sumber F16 secara langsung tanpa memerlukan salinan konversi.

Implementasi memastikan bahwa `supports_op` dan panggilan dispatch berbagi predikat tunggal yang memeriksa kondisi kontiguitas dan bentuk, menutup celah di mana ketidakcocokan dapat menyebabkan kegagalan asersi. Test-backend-ops pada GPU A10 lulus semua 1297 uji MUL_MAT, termasuk 6 kasus Hadamard F16 baru alongside yang ada F32.

Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL, dan Snapdragon.