llama.cpp प्रोजेक्ट ने संस्करण b10844 जारी किया, जिसमें Vulkan बैकएंड में DeepSeek-V4 हाइपर-कनेक्शन फ्यूज्ड ऑपरेशन्स (DSV4_HC_COMB/PRE/POST) के लिए समर्थन पेश किया गया है। यह अपडेट इन विशिष्ट अनुकूलनों के संदर्भ में Vulkan को CUDA और Metal के बराबर लाता है।

  • नया dsv4_hc_comb ऑपरेशन रजिस्टरों में पूर्ण 20-आवृत्ति Sinkhorn एल्गोरिदम चलाता है, जिसने प्रति साइट लगभग 137 क्रमित नोड निष्पादन को एकल डिस्पैच से बदल दिया।
  • dsv4_hc_pre और dsv4_hc_post प्रति-टोकन गुणांकों के लिए शेयर किए गए मेमोरी का उपयोग करके एलिमेंटवाइज स्ट्रीम कॉलाप्स और फैन-आउट संभालते हैं।
  • अनफ्यूज्ड Sinkhorn कॉम्ब चेन पहले gfx1151 हार्डवेयर पर प्रति टोकन लगभग 16k डिस्पैच के आसपास डिकोड ऑप समय का लगभग 32% हिस्सा लेती थी।
  • GGML_VK_DISABLE_DSV4_HC और व्यक्तिगत _COMB, _PRE, और _POST फ्लैग्स जैसे पर्यावरण चर उपयोगकर्ताओं को इन ऑपरेशन्स को स्वतंत्र रूप से अक्षम करने की अनुमति देते हैं।

यह परिवर्तन DeepSeek-V4 मॉडल चला रहे Vulkan उपयोगकर्ताओं के लिए अनफ्यूज्ड प्राइमिटिव चेन द्वारा उत्पन्न प्रदर्शन बॉटलनेक को समाप्त करता है।