llama.cpp b11265 릴리스에는 Vulkan 백엔드의 Mixture of Experts (MoE) 모델 처리에 대한 수정이 포함되어 있습니다. 이 업데이트는 `mat_mul_id`가 행렬 곱셈 타일을 선택하는 방식을 수정하여 디스패치 중 작업자가 대기 상태가 되는 성능 문제를 해결합니다.

  • 이전에는 타일 선택이 총 토큰 수에 의존했으며, 이는 MoE 디스패치 그리드에서 실제 N이 워킹 그룹당 전문가별 행이기 때문에 올바르지 않았습니다.
  • pp128을 사용하는 Sarvam 30B와 같은 모델에서 이 오류로 인해 피커가 128 대신 약 6개의 활성 행에 대한 타일을 선택했습니다.
  • 수정으로 인해 그룹의 모든 작업자가 작업을 수행하게 되어, 이전에는 작업 기간의 55%를 차지했던 낭비된 시간이 제거되었습니다.

이 변경은 GPU 작업자 간 적절한 워크로드 분배를 보장하여 Vulkan에서 MoE 모델의 추론 효율성을 향상시킵니다.