Le projet llama.cpp a publié la version b10844, introduisant le support des opérations fusionnées hyper-connexion DeepSeek-V4 (DSV4_HC_COMB/PRE/POST) dans le backend Vulkan. Cette mise à jour aligne Vulkan sur CUDA et Metal en ce qui concerne ces optimisations spécifiques.
- La nouvelle opération dsv4_hc_comb exécute l'algorithme Sinkhorn complet de 20 itérations dans les registres, remplaçant environ 137 exécutions de nœuds ordonnés par site par un seul dispatch.
- dsv4_hc_pre et dsv4_hc_post gèrent l'effondrement et la diffusion en flux élémentaire à l'aide de mémoire partagée pour les coefficients par token.
- La chaîne comb Sinkhorn non fusionnée représentait auparavant environ 32 % du temps d'exécution des opérations de décodage sur le matériel gfx1151, à travers environ 16k dispatches par token.
- Les variables d'environnement GGML_VK_DISABLE_DSV4_HC, ainsi que les indicateurs individuels _COMB, _PRE et _POST, permettent aux utilisateurs de désactiver ces opérations indépendamment.
Cette modification élimine le goulot d'étranglement de performance causé par la chaîne de primitives non fusionnées pour les utilisateurs de Vulkan exécutant des modèles DeepSeek-V4.