llama.cpp 프로젝트는 Vulkan mul_mat_id 연산의 hoisted row-id 한계를 256명에서 1024명으로 늘렸습니다. 이 변경은 이전에 공유 배열 크기 제약으로 인해 더 느린 코드 경로를 실행했던 Qwen3.8-Flash-Next와 같은 대규모 전문가 수를 가진 모델의 성능 병목 현상을 해결합니다.

업데이트는 count_experts.comp 셰이더를 수정하여 MAX_EXPERTS 상수를 1024로 사용하고, Vulkan의 16 KiB 보장 범위 내에서 공유 배열을 12 KiB로 증가시킵니다. 배치 크기가 2048인 Strix Halo 하드웨어에서 iq3_s의 경우 전문가 행렬 곱셈이 연산당 12.5ms에서 9.5ms로, iq4_nl의 경우 14.0ms에서 7.5ms로 줄어듭니다. 프롬프트 처리 속도는 8k 토큰 기준 약 19% 향상되었으며, MUL_MAT_ID 백엔드 테스트가 새로운 1024 전문가 사례와 함께 통과했습니다.

이 최적화를 통해 llama.cpp는 Vulkan 호환 하드웨어에서 성능 저하 없이 이전의 512 전문가 임계값을 초과하는 모델을 효율적으로 처리할 수 있습니다.