Le projet llama.cpp a publié la version b11203, qui inclut une modification du Transformée de Walsh-Hadamard rapide (FWHT) de CUDA pour accepter les entrées F16. Auparavant, le FWHT CUDA n'acceptait que des entrées F32 ; cette mise à jour rend le type source un paramètre de modèle afin que le noyau lise directement une source F16 sans nécessiter de copie convertie.
L'implémentation garantit que `supports_op` et l'appel de dispatch partagent un prédicat unique vérifiant les conditions de contiguïté et de forme, comblant ainsi un vide où des incompatibilités auraient pu causer des échecs d'assertion. Test-backend-ops sur un GPU A10 a passé tous les 1297 tests MUL_MAT, y compris 6 nouveaux cas Hadamard F16 alongside les existants F32.
Cette version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL et Snapdragon.