llama.cpp 프로젝트는 NVFP4 W4A4 활성화 양자화를 개선하기 위해 CUDA 백엔드에 상당한 업데이트를 포함한 버전 b10099를 출시했습니다.
- 더 나은 성능을 위한 채널별 amax 및 양자화 커널 융합.
- NVIDIA 하드웨어에서 사용 가능한 경우 nvfp4x4 intrinsic 지원 추가.
- intrinsic으로 스케일 검색 최적화 및 블록별 amax 계산 복원.
- 오버헤드를 줄이기 위해 32바이트 로드 및 포인터 산술 최적화 구현.
- HIP 호환성 문제를 명시하며 NVIDIA에 대해 builtin_align(32) 구조체 사용을 보호.
이 릴리스는 CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL 및 기타 백엔드를 통해 macOS, Linux, Windows, Android 및 openEuler에 대한 업데이트된 바이너리를 제공합니다.