llama.cpp 프로젝트는 F16 입력을 수용하기 위한 CUDA Fast Walsh-Hadamard Transform (FWHT) 변경 사항을 포함하는 버전 b11203을 출시했습니다. 이전에는 CUDA FWHT가 F32 입력만 수용했지만, 이 업데이트로 소스 유형이 템플릿 매개변수가 되어 커널이 변환된 복사본 없이 F16 소스를 직접 읽습니다.
구현은 `supports_op`와 디스패치 호출이 연속성 및 모양 조건을 확인하는 단일 술어를 공유하여 불일치가 어설션 실패를 유발할 수 있는 간격을 닫았습니다. A10 GPU에서 test-backend-ops는 기존 F32 사례와 함께 6개의 새로운 F16 Hadamard 사례를 포함한 모든 1297개 MUL_MAT 테스트를 통과했습니다.
이 릴리스는 CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL 및 Snapdragon 백엔드를 위한 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.