llama.cpp b10089 릴리스는 k-quants, i-quants 및 mxfp4 양자화 형식을 지원하도록 CUDA GET_ROWS 작업을 확장합니다. 이 변경으로 모든 양자화된 GGML 유형이 이제 임베딩 조회를 위한 직접 장치 경로를 사용할 수 있게 됩니다.

  • Q4_K_M과 같은 일반적인 GGUF 레시피를 처리하기 위해 k-quant 지원(q2_K에서 q6_K까지) 추가.
  • 32스레드 레이아웃을 가진 9개의 i-quants로 공유 슈퍼블록 디쿼랜자 확장.
  • mxfp4 디쿼랜자를 공유 헬퍼로 이동하여 CUDA의 GET_ROWS 유형 커버리지 완료.
  • 불필요한 호스트 폴백을 방지하기 위해 32값 서브블록 유형(iq4_nl 및 mxfp4)에 대해서만 행 크기 검사를 게이트합니다.

이러한 양자화 유형에 대해 스케줄러가 호스트로 폴백하는 것을 방지함으로써 이 업데이트는 단일 장치 그래프에서 각 토큰마다 전체 임베딩 행렬을 복사하는 것을 피합니다.