llama.cpp प्रोजेक्ट ने संस्करण b11403 जारी किया, जिसमें CUDA अनुकूलन शामिल है जो छोटे बैच आकार पर पतले f16 और bf16 मैट्रिक्स गुणन के लिए MMVF कर्नेल का उपयोग करने के लिए है।
- NVIDIA GPUs पर बेहतर प्रदर्शन के लिए कर्नेल चयन तर्क समायोजित किया गया।
- macOS (Apple Silicon और Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android, और openEuler के लिए बाइनरी प्रदान किए गए।
- मानक बाइनरी के साथ iOS XCFramework और UI बिल्ड शामिल किए गए।