llama.cpp 프로젝트가 버전 b10791을 출시하여 양자화된 언어 모델 헤드와 디코딩 GEMV 연산에 대한 상당한 OpenCL 최적화를 도입했습니다. 이 업데이트에는 추론 디코딩과 멀티 토큰 예측에 관련된 미디엄 배치 GEMM 개선 사항도 포함되어 있습니다.
- 추론 디코딩/MTP를 위해 opencl 양자화된 lm_head / 디코딩 GEMV 및 미디엄 배치 GEMM을 최적화합니다.
- 비-Adreno 빌드에 대해 q4_K/q6_K 타일된 ns 변환 커널 등록을 보호합니다.
- q4_K MUL_MAT+GLU 융합 분배를 Adreno 하드웨어에 특정하게 제한합니다.
- q4_K GLU 융합 게이트에서 noshuffle 가중치 레이아웃을 요구합니다.
- 정렬되지 않은 행 스트라이드에서 벡터화된 f16 mrow GEMV 경로를 사용하지 않도록 방지합니다.
- 성능 향상 측정이 이루어진 경우에만 q4_K split-K 디코딩 GEMV를 활성화합니다.
- 타일된 lm_head/embed GEMV 기본값을 X2E/A8X 아키텍처로 제한합니다.
이 릴리스는 CPU, GPU 및 다양한 가속기 백엔드 전반에 걸쳐 macOS, iOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.