llama.cpp 프로젝트는 벡터 양자화(MMVQ)가 포함된 MoE 혼합 아키텍처에 공유 전문가를 융합하기 위한 CUDA 최적화를 포함하는 빌드 b11370을 출시했습니다. 이 변경은 풀 리퀘스트 #29184의 일부이며 stride_col_dst에 대한 버퍼 널 체크 및 인수 처리도 처리합니다.
- CUDA 백엔드를 위해 MMVQ에 공유 전문가를 융합합니다.
- 안정성을 향상시키기 위해 버퍼에 대한 널 체크를 추가합니다.
- stride_col_dst를 융합 인수로 이동합니다.
이 릴리스는 CPU, Vulkan, ROCm, OpenVINO, SYCL 및 Snapdragon을 비롯한 다양한 하드웨어 가속기를 위한 macOS, Linux, Windows, Android 및 iOS용 업데이트된 바이너리를 제공합니다.