Проект llama.cpp выпустил версию b11203, которая включает изменение в CUDA Fast Walsh-Hadamard Transform (FWHT) для приема входных данных F16. Ранее CUDA FWHT принимал только входные данные F32; это обновление делает исходный тип параметром шаблона, так что ядро читает источник F16 напрямую, без необходимости преобразованной копии.

Реализация гарантирует, что `supports_op` и вызов диспетчеризации используют единый предикат для проверки условий непрерывности и формы, устраняя пробел, где несоответствия могли вызывать сбои утверждений. Тесты test-backend-ops на GPU A10 прошли все 1297 тестов MUL_MAT, включая 6 новых случаев F16 Hadamard вместе с существующими случаями F32.

Этот релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL и Snapdragon.