llama.cpp प्रोजेक्ट ने संस्करण b10099 जारी किया, जिसमें NVFP4 W4A4 सक्रियण क्वांटीज़ेशन में सुधार के लिए CUDA बैकएंड में एक महत्वपूर्ण अपडेट शामिल है।

  • बेहतर प्रदर्शन के लिए फ्यूज्ड प्रति-चैनल amax और क्वांटीज़ेशन kernels.
  • NVIDIA हार्डवेयर पर उपलब्ध होने पर nvfp4x4 intrinsic का समर्थन जोड़ा गया।
  • intrinsic के साथ स्केल-खोज को अनुकूलित किया और प्रति-ब्लॉक amax गणनाओं को पुनर्स्थापित किया।
  • ओवरहेड कम करने के लिए 32-बाइट लोड और पॉइंटर अंकगणित अनुकूलन लागू किए गए।
  • HIP संगतता समस्याओं का उल्लेख करते हुए, विशेष रूप से NVIDIA के लिए builtin_align(32) संरचना उपयोग को सुरक्षित किया गया।

यह रिलीज़ CPU, CUDA, Vulkan, ROCm, OpenVINO, SYCL और अन्य बैकएंड्स के लिए macOS, Linux, Windows, Android और openEuler के लिए अद्यतन बाइनरी प्रदान करती है।