llama.cpp 프로젝트는 ne00 < 1024에 대한 나머지 iq mul_mv 커널의 유휴 스레드에 대한 수정을 포함하는 버전 b10908을 출시했습니다. 이 변경은 행 분할 로직을 여섯 가지 특정 커널(iq1_s, iq1_m, iq2_xxs, iq2_xs, iq2_s, iq3_s)로 일반화합니다.
- 수정은 행이 32개 미만의 청크를 가지는 경우를 처리하여 스레드가 청크를 공유하고 행의 슬라이스를 가져올 수 있게 합니다.
- q2, dh, sc, qh 및 부호가 xr에서 파생되므로 iq mul_mv 커널에서 src0 행 포인터를 한 번 오프셋합니다.
- 구현은 iq mul_mv 행 분할을 offset0에 통합하여 x와 그 파생 포인터가 기존 경로에 유지되도록 합니다.
이 릴리스는 CPU, CUDA, ROCm, Vulkan 및 SYCL을 포함한 다양한 아키텍처를 위한 macOS, Linux, Android, Windows 및 openEuler용 바이너리를 제공합니다.