llama.cpp 项目发布了 b10844 版本,在 Vulkan 后端引入了对 DeepSeek-V4 超连接融合操作(DSV4_HC_COMB/PRE/POST)的支持。此次更新使 Vulkan 在这些特定优化方面与 CUDA 和 Metal 持平。
- 新的 dsv4_hc_comb 操作在寄存器中运行完整的 20 次 Sinkhorn 算法,将每个站点约 137 次有序节点执行替换为单次分发。
- dsv4_hc_pre 和 dsv4_hc_post 使用每 token 系数的共享内存处理元素流折叠和扇出。
- 未融合的 Sinkhorn 组合链此前在 gfx1151 硬件上,每个 token 约 16k 次分发的情况下,占了解码操作时间的约 32%。
- 环境变量 GGML_VK_DISABLE_DSV4_HC 以及单独的 _COMB、_PRE 和 _POST 标志允许用户独立禁用这些操作。
此更改消除了 Vulkan 用户运行 DeepSeek-V4 模型时由未融合原语链引起的性能瓶颈。