llama.cpp 프로젝트는 IQ 양자화된 모델에서 큰 배치 크기를 처리하기 위한 상당한 성능 최적화를 도입한 버전 b10726을 출시했습니다. 주요 업데이트는 배치된 GEMM 연산을 통해 그리드 IQ 양자화를 가속화하기 위해 AVX2 명령을 활용합니다.

  • 그리드 IQ 양자화에 대한 배치된 GEMM 구현
  • 속도 향상을 위해 임계값을 낮춘 IQ 패널 디코딩의 벡터화
  • ggml_gemm_iqp_8x8_q8_K_p4 커널 도입 및 gather 버퍼 제거
  • 단일 소스 gather 레이아웃, 게이트 바이어스, IQ 패널에 대한 벡터화된 인터리브
  • IQP 커버리지를 위한 NUMA 폴백 지원 및 10행 배치 테스트 추가

이 릴리스는 호환되는 하드웨어에서 IQ 모델을 실행하는 사용자에게 더 빠른 추론 기능을 제공합니다.