llama.cpp 프로젝트는 호스트/드라이버 오버헤드를 줄이기 위해 RMS_NORM과 SCALE 연산을 단일 CUDA 커널로 통합했습니다. 이전에는 별도의 SCALE 노드가 추가적인 커널 실행을 유발했는데, 이는 일반 배치 처리에서는 무시할 수 있었지만 드래프트-MTP 추론 디코딩 중 지연 시간을 크게 증가시켰습니다.
- 통합은 rms_norm_f32에 do_scale 플래그를 추가하여 결합된 경로가 커널, 축소, 실행기를 공유하면서 비트 단위 수치적 동등성을 유지하도록 합니다.
- Qwen3.8-27B 모델이 탑재된 2x GTX 1080 Ti 환경에서 드래프트-MTP 조건 하에 8000토큰과 20000토큰 모두에서 초기 프리필프 처리량이 각각 4.2%, 4.8% 향상되었습니다.
- ubatch당 실행 횟수가 1032.9 + 841.7에서 978.9 + 799.7로 감소하여 GPU 연산 합계는 변경하지 않고 이전 기준치와 일치했습니다.
- RMS_NORM_SCALE, NORM_SCALE 및 관련 연산에 대한 모든 백엔드 테스트가 두 GPU 모두에서 통과했으며, 퍼플렉시티는 비통합 빌드와 동일하게 유지됩니다.
이 최적화는 커널 실행의 누적 비용을 줄임으로써 추론 디코딩 시나리오에서 추론 속도를 향상시킵니다.