Проект llama.cpp выпустил версию b10844, добавившую поддержку гиперсвязанных объединённых операций (DSV4_HC_COMB/PRE/POST) для DeepSeek-V4 в бэкенде Vulkan. Это обновление доводит Vulkan до уровня CUDA и Metal в отношении этих конкретных оптимизаций.
- Новая операция dsv4_hc_comb выполняет полный 20-итерационный алгоритм Sinkhorn в регистрах, заменяя примерно 137 упорядоченных выполнений узлов на узел одним вызовом диспетчеризации.
- dsv4_hc_pre и dsv4_hc_post обрабатывают сжатие потоков поэлементно и разветвление с использованием общей памяти для коэффициентов на токен.
- Необъединённая цепочка Sinkhorn comb ранее занимала около 32% времени выполнения операции декодирования на оборудовании gfx1151 при примерно 16k вызовов диспетчеризации на токен.
- Переменные окружения GGML_VK_DISABLE_DSV4_HC, а также отдельные флаги _COMB, _PRE и _POST позволяют пользователям отключать эти операции независимо друг от друга.
Это изменение устраняет узкое место производительности, вызванное необъединённой цепочкой примитивов, для пользователей Vulkan, работающих с моделями DeepSeek-V4.