llama.cpp प्रोजेक्ट ने संस्करण b11203 जारी किया, जिसमें CUDA Fast Walsh-Hadamard Transform (FWHT) में एक बदलाव शामिल है जो F16 इनपुट को स्वीकार करने के लिए है। पहले, CUDA FWHT केवल F32 इनपुट स्वीकार करता था; यह अपडेट स्रोत प्रकार को एक टेम्पलेट पैरामीटर बना देता है ताकि कर्नेल सीधे F16 स्रोत पढ़ सके बिना किसी परिवर्तित कॉपी की आवश्यकता के।

इस कार्यान्वयन में सुनिश्चित किया जाता है कि `supports_op` और डिस्पैच कॉल एक ही प्रेडिकेट साझा करें जो निरंतरता और आकार की शर्तों की जांच करता है, जिससे उन अंतराल को बंद कर दिया गया जहाँ असंगतियां एसर्शन विफलता का कारण बन सकती थीं। A10 GPU पर test-backend-ops ने सभी 1297 MUL_MAT टेस्ट पास किए, जिसमें मौजूदा F32 के साथ 6 नए F16 Hadamard मामले भी शामिल हैं।

इस रिलीज में CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL और Snapdragon बैकएंड्स के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान की गई हैं।