llama.cpp 프로젝트는 CUDA 백엔드에 중요한 업데이트를 포함하는 버전 b10718을 출시했습니다. 가장 주목할 만한 변경은 Mixture of Experts (MOE) 융합을 스펜크티브 디코딩(specdec) 지원을 위해 확장하여, 이전 MOE glu 융합과 topk-router 융합이 한 번에 하나의 토큰만 처리하도록 제한되었던 문제를 해결한 것입니다.
- CUDA: specdec에 대해 MOE 융합을 확장하여 이전 MOE glu 및 topk-router 융합의 단일 토큰 제한을 제거했습니다.
- 멀티 토큰 MOE 융합 구현에 SWIGLU_CLAMP 케이스 지원을 추가했습니다.
- 풀 리퀘스트 #27621의 리뷰 코멘트를 처리했습니다.
이 업데이트는 NVIDIA GPU에서 더 효율적인 융합 연산을 활성화하여 스펜크티브 디코딩을 사용하는 모델의 성능을 향상시킵니다.