O projeto llama.cpp lançou a versão b11203, que inclui uma alteração no Fast Walsh-Hadamard Transform (FWHT) da CUDA para aceitar entradas F16. Anteriormente, o FWHT da CUDA aceitava apenas entradas F32; esta atualização torna o tipo de origem um parâmetro de modelo para que o kernel leia uma fonte F16 diretamente sem exigir uma cópia convertida.

A implementação garante que `supports_op` e a chamada de despacho compartilhem um único predicado verificando condições de contiguidade e forma, fechando uma lacuna onde incompatibilidades poderiam causar falhas de asserção. Test-backend-ops em uma GPU A10 passou todos os 1297 testes MUL_MAT, incluindo 6 novos casos de Hadamard F16 junto com os existentes F32.

Este lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL e Snapdragon.