llama.cpp 프로젝트는 전문가 수가 마이크로 배치 크기보다 훨씬 클 때 발생하는 CUDA MMQ 메모리 오류를 수정한 버전 b11390을 출시했습니다.
- Mixture-of-Experts (MMQ) 처리와 관련된 CUDA 백엔드의 메모리 오류를 해결합니다.
- macOS (Apple Silicon 및 Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android 및 openEuler용 바이너리를 제공합니다.
- 업데이트된 UI 빌드를 포함합니다.
이 업데이트는 특정 메모리 접근 오류를 방지하여 CUDA 하드웨어에서 Mixture-of-Experts 모델을 실행하는 사용자에게 안정성을 보장합니다.