Проект llama.cpp выпустил версию b10844, добавившую поддержку гиперсвязанных объединённых операций (DSV4_HC_COMB/PRE/POST) для DeepSeek-V4 в бэкенде Vulkan. Это обновление доводит Vulkan до уровня CUDA и Metal в отношении этих конкретных оптимизаций.

  • Новая операция dsv4_hc_comb выполняет полный 20-итерационный алгоритм Sinkhorn в регистрах, заменяя примерно 137 упорядоченных выполнений узлов на узел одним вызовом диспетчеризации.
  • dsv4_hc_pre и dsv4_hc_post обрабатывают сжатие потоков поэлементно и разветвление с использованием общей памяти для коэффициентов на токен.
  • Необъединённая цепочка Sinkhorn comb ранее занимала около 32% времени выполнения операции декодирования на оборудовании gfx1151 при примерно 16k вызовов диспетчеризации на токен.
  • Переменные окружения GGML_VK_DISABLE_DSV4_HC, а также отдельные флаги _COMB, _PRE и _POST позволяют пользователям отключать эти операции независимо друг от друга.

Это изменение устраняет узкое место производительности, вызванное необъединённой цепочкой примитивов, для пользователей Vulkan, работающих с моделями DeepSeek-V4.