llama.cpp 프로젝트는 일반적인 소수 행 행렬 곱셈(MMA) 커널을 확장하여 BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 및 다양한 IQ 유형을 포함한 추가 소스 데이터 유형을 지원하도록 했습니다. 이 업데이트는 최적화된 커널이 16-가중치 디쿼ン타이저가 있는 모든 유형을 처리할 수 있게 하며, 성능이 현재 커널을 초과하기 시작하는 M3 Ultra 하드웨어에서 특정 행 수 임계값을 적용합니다.
- 새로운 지원에는 BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 및 IQ 유형이 포함됩니다.
- 유형별 성능 임계값은 다음과 같습니다: TQ2_0의 경우 5행, BF16의 경우 4행, MXFP4/Q2_0/Q2_K/IQ4_NL의 경우 3행, 기타 유형의 경우 2행입니다.
- M3 Ultra에서의 벤치마크 결과는 행 수와 커널 중첩에 따라 0.23에서 1.01까지의 성능 비율을 보여줍니다.
이 변경은 낮은 행 수에서 MMA 커널의 기능을 활용하여 더 넓은 범위의 양자화 형식에 대한 추론 효율성을 향상시킵니다.