El proyecto llama.cpp lanzó la versión b11203, que incluye un cambio en la Transformada Rápida de Walsh-Hadamard (FWHT) de CUDA para aceptar entradas F16. Anteriormente, el FWHT de CUDA solo aceptaba entradas F32; esta actualización hace que el tipo de origen sea un parámetro de plantilla para que el kernel lea una fuente F16 directamente sin requerir una copia convertida.
La implementación asegura que `supports_op` y la llamada de despacho compartan un único predicado que verifica las condiciones de contigüidad y forma, cerrando una brecha donde las discrepancias podrían causar fallos de aserción. Test-backend-ops en una GPU A10 pasó todas las 1297 pruebas MUL_MAT, incluyendo 6 nuevos casos de Hadamard F16 junto con los existentes F32.
Este lanzamiento proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de backends CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL y Snapdragon.