O projeto llama.cpp lançou a versão b10844, introduzindo suporte para operações fundidas de hiperconexão DeepSeek-V4 (DSV4_HC_COMB/PRE/POST) no backend Vulkan. Esta atualização traz o Vulkan ao mesmo nível que CUDA e Metal em relação a essas otimizações específicas.
- A nova operação dsv4_hc_comb executa o algoritmo Sinkhorn completo de 20 iterações nos registradores, substituindo aproximadamente 137 execuções de nós ordenados por localidade por um único despacho.
- dsv4_hc_pre e dsv4_hc_post lidam com colapso de fluxo elementar e fan-out usando memória compartilhada para coeficientes por token.
- A cadeia combinatória Sinkhorn não fundida anteriormente representava cerca de 32% do tempo de operação de decode no hardware gfx1151, através de aproximadamente 16k despachos por token.
- As variáveis de ambiente GGML_VK_DISABLE_DSV4_HC, juntamente com as sinalizações individuais _COMB, _PRE e _POST, permitem que os usuários desativem essas operações independentemente.
Esta alteração elimina o gargalo de desempenho causado pela cadeia primitiva não fundida para usuários Vulkan que executam modelos DeepSeek-V4.