llama.cpp प्रोजेक्ट ने संस्करण b10330 जारी किया है, जिसमें एक CUDA अनुकूलन पेश किया गया है जो rms_norm, गुणा और RoPE ऑपरेशन को एकल kernel में फ्यूज करता है। इस बदलाव के साथ फ्यूज किए गए ऑपरेशन के लिए मेमोरी रेंज चेक और ब्रॉडकास्ट वेट्स के लिए नए टेस्ट केस शामिल हैं।
- CUDA: rms_norm + mul + rope (+ view + set_rows) को फ्यूज करें
- tests: rms_norm_mul_rope में ब्रॉडकास्ट वेट केस जोड़ें
- CUDA: rms_norm rope फ्यूजन से पहले मेमोरी रेंज की जांच करें
- CUDA: rope set_rows फ्यूजन में मेमोरी रेंज की जांच करें
रिलीज में CPU, Vulkan, ROCm, OpenVINO, SYCL और HIP सहित विभिन्न हार्डवेयर बैकएंड्स के लिए macOS, Linux, Windows, Android और iOS के लिए बाइनरी प्रदान की गई हैं।