llama.cpp 프로젝트가 버전 b10844를 출시하여 Vulkan 백엔드에서 DeepSeek-V4 하이퍼커넥션 융합 연산(DSV4_HC_COMB/PRE/POST)에 대한 지원을 도입했습니다. 이 업데이트는 이러한 특정 최적화와 관련하여 Vulkan을 CUDA 및 Metal과 동등한 수준으로 맞춥니다.

  • 새로운 dsv4_hc_comb 연산은 레지스터에서 전체 20회 반복 Sinkhorn 알고리즘을 실행하여 사이트당 약 137개의 순차적 노드 실행을 단일 디스패치로 대체합니다.
  • dsv4_hc_pre 및 dsv4_hc_post는 토큰별 계수를 위해 공유 메모리를 사용하여 요소별 스트림 병합과 팬아웃을 처리합니다.
  • 융합되지 않은 Sinkhorn comb 체인은 gfx1151 하드웨어에서 토큰당 약 16k개의 디스패치에 걸쳐 디코드 연산 시간의 약 32%를 차지했습니다.
  • GGML_VK_DISABLE_DSV4_HC 환경 변수와 개별 _COMB, _PRE, _POST 플래그를 통해 사용자는 이러한 연산을 독립적으로 비활성화할 수 있습니다.

이 변경으로 Vulkan을 사용하는 DeepSeek-V4 모델 실행 시 융합되지 않은 원시 체인으로 인한 성능 병목 현상이 제거되었습니다.