El proyecto llama.cpp lanzó la versión b10844, introduciendo soporte para operaciones fusionadas de hiperconexión DeepSeek-V4 (DSV4_HC_COMB/PRE/POST) en el backend de Vulkan. Esta actualización lleva a Vulkan al mismo nivel que CUDA y Metal en cuanto a estas optimizaciones específicas.

  • La nueva operación dsv4_hc_comb ejecuta el algoritmo completo de Sinkhorn de 20 iteraciones en registros, reemplazando aproximadamente 137 ejecuciones de nodos ordenados por sitio con un único envío.
  • dsv4_hc_pre y dsv4_hc_post manejan el colapso de flujo elemento a elemento y la distribución utilizando memoria compartida para los coeficientes por token.
  • La cadena combinada Sinkhorn no fusionada anteriormente representaba aproximadamente el 32% del tiempo de operación de decodificación en hardware gfx1151 a través de aproximadamente 16k envíos por token.
  • Las variables de entorno GGML_VK_DISABLE_DSV4_HC, junto con las banderas individuales _COMB, _PRE y _POST, permiten a los usuarios desactivar estas operaciones de forma independiente.

Este cambio elimina el cuello de botella de rendimiento causado por la cadena de primitivas no fusionadas para los usuarios de Vulkan que ejecutan modelos DeepSeek-V4.