llama.cpp b11405 रिलीज ने छोटे हेड गिनती के साथ प्रदर्शन समस्याओं को दूर करते हुए, चार हेड्स के लिए कुंजियों और टोकन पर लाइटनिंग इंडेक्सर को टाइल करके CUDA बैकएंड को अपडेट किया है।

  • कर्नेल सभी हेड्स के लिए क्वेरीज़ और वजन को एक साथ स्टोर करता है, प्रत्येक अर्ध-सटीक कुंजी तत्व को एक बार चौड़ा करके फ्लोट राउंड ट्रिप के बिना सभी हेड्स को feed करता है।
  • q * k का f16 रेंज से अधिक होने पर half2 उत्पादों से ओवरफ्लो को रोकने के लिए क्वेरीज़ शेयर्ड मेमोरी में फ्लोट में रहती हैं।
  • प्रत्येक थ्रेड अब एकल टोकन के लिए दो कुंजियों का स्कोर देता है, जिससे शेयर्ड रीड्स कम होते हैं और gfx908 को 63 VGPRs के साथ कोई रजिस्टर स्पिल नहीं होता।
  • यह अनुकूलन R9700 पर कर्नेल को 36x तेज़ बनाता है और CUDA हार्डवेयर पर थोड़ा तेज़ करता है।

यह रिलीज CPU, GPU (CUDA, ROCm, Vulkan, OpenCL), और NPU बैकएंड्स के लिए macOS, Linux, Windows, Android, और openEuler के लिए बाइनरी प्रदान करती है।