Proyek llama.cpp merilis versi b10844, memperkenalkan dukungan untuk operasi fusi hyper-connection DeepSeek-V4 (DSV4_HC_COMB/PRE/POST) di backend Vulkan. Pembaruan ini membawa Vulkan setara dengan CUDA dan Metal dalam hal optimasi spesifik ini.

  • Operasi dsv4_hc_comb baru menjalankan algoritma Sinkhorn penuh 20 iterasi di register, menggantikan sekitar 137 eksekusi node berurutan per situs dengan satu dispatch.
  • dsv4_hc_pre dan dsv4_hc_post menangani keruntuhan aliran elementwise dan fan-out menggunakan memori bersama untuk koefisien per-token.
  • Rantai comb Sinkhorn yang tidak difusi sebelumnya menyumbang sekitar 32% dari waktu operasi decode pada perangkat keras gfx1151 di sekitar 16k dispatch per token.
  • Variabel lingkungan GGML_VK_DISABLE_DSV4_HC, bersama dengan flag individual _COMB, _PRE, dan _POST, memungkinkan pengguna menonaktifkan operasi ini secara independen.

Perubahan ini menghilangkan hambatan kinerja yang disebabkan oleh rantai primitif yang tidak difusi bagi pengguna Vulkan yang menjalankan model DeepSeek-V4.