llama.cpp 프로젝트가 Mixture of Experts (MoE) 모델을 위한 IQ 타입 처리를 도입한 빌드 b10868을 출시했습니다.

  • pull request #28476을 통해 MoE 아키텍처 내에서 IQ 양자화 타입 지원을 추가했습니다.
  • macOS (Apple Silicon 및 Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android 및 openEuler용 바이너리를 제공합니다.
  • iOS XCFramework 지원 및 독립형 UI 패키지를 포함합니다.

이 업데이트를 통해 사용자는 다양한 하드웨어 플랫폼에서 특정 IQ 양자화 타입의 MoE 모델을 실행할 수 있습니다.