أصدر مشروع llama.cpp الإصدار b10099، والذي يتضمن تحديثًا كبيرًا لخلفية CUDA لتحسين كمي التنشيط NVFP4 W4A4.
- نوى مدمجة لـ amax لكل قناة والكمي لأداء أفضل.
- تمت إضافة دعم للبداهيات nvfp4x4 عند توفرها على أجهزة NVIDIA.
- تم تحسين بحث المقياس باستخدام البداهيات واستعادة حسابات amax لكل كتلة.
- تم تنفيذ تحميلات 32 بايت وتحسينات حساب المؤشرات لتقليل الحمل الإضافي.
- تم حماية استخدام بنية builtin_align(32) خصيصًا لـ NVIDIA، مع ملاحظة مشاكل التوافق مع HIP.
يوفر هذا الإصدار ملفات ثنائية محدثة لأنظمة macOS و Linux و Windows و Android و openEuler عبر CPU و CUDA و Vulkan و ROCm و OpenVINO و SYCL وخلفيات أخرى.