llama.cpp 프로젝트는 CUDA 백엔드를 업데이트하여 사용된 전문가 수(n_expert_used)에 관계없이 최적화된 mm_ids_helper 경로를 사용하도록 하는 버전 b10704를 출시했습니다. 이전에는 이 빠른 경로가 와프 크기 나눗셈 규칙으로 제한되어 대부분의 경우 느린 일반 구현으로 폴백되었습니다.
- 이 최적화는 다음 2의 거듭제곱까지 패딩을 일반화하여 n_expert_used = 10과 같은 경우에도 빠른 경로를 사용할 수 있게 합니다.
- RTX PRO 6000에서 Qwen3.8-Flash-Next(512 전문가, 10 사용, 컨텍스트 55k)로 측정한 결과 프롬프트 처리 속도가 초당 2334 토큰에서 2600 토큰으로 증가했습니다.
- 토큰 생성 성능은 영향을 받지 않습니다. 이 최적화는 배치된 토큰 처리를 대상으로 하기 때문입니다.
이 변경은 프롬프트 처리 중 오버헤드를 줄여 Mixture of Experts 아키텍처를 사용하는 모델의 추론 지연 시간을 개선합니다.