llama.cpp 프로젝트가 CPU 백엔드에서 k-quants를 위한 타일화된 행렬 곱셈 구현을 도입한 버전 b11195를 출시했습니다. 이 변경은 양자화된 데이터를 256x256 int8 타일로 풀어서 마이크로커널을 사용하여 결과를 계산함으로써 대규모 행렬 연산의 성능을 향상시킵니다.
- 타일화된 mul_mat은 4096x64 * 64x4096 차원에서 손익분기점을 가지며, 대규모 행렬 곱셈에 대해 3-6배의 속도 개선을 제공합니다.
- 오류율은 미미하며, 최대 오류는 약 1-e04이고 RMSE는 약 1-e05입니다.
- 이번 릴리스에는 ARM 및 Windows 빌드에 대한 수정, Q5_K 및 IQ4_XS 벤치마크를 위한 통합된 IQP 지원, 그리고 최적화된 AVX2 커널이 포함되어 있습니다.
이 업데이트는 지원되는 플랫폼 전반에서 수치적 정확성을 유지하면서 대규모 행렬 연산의 추론 속도를 향상시킵니다.