أصدر مشروع llama.cpp الإصدار b10099، والذي يتضمن تحديثًا كبيرًا لخلفية CUDA لتحسين كمي التنشيط NVFP4 W4A4.

  • نوى مدمجة لـ amax لكل قناة والكمي لأداء أفضل.
  • تمت إضافة دعم للبداهيات nvfp4x4 عند توفرها على أجهزة NVIDIA.
  • تم تحسين بحث المقياس باستخدام البداهيات واستعادة حسابات amax لكل كتلة.
  • تم تنفيذ تحميلات 32 بايت وتحسينات حساب المؤشرات لتقليل الحمل الإضافي.
  • تم حماية استخدام بنية builtin_align(32) خصيصًا لـ NVIDIA، مع ملاحظة مشاكل التوافق مع HIP.

يوفر هذا الإصدار ملفات ثنائية محدثة لأنظمة macOS و Linux و Windows و Android و openEuler عبر CPU و CUDA و Vulkan و ROCm و OpenVINO و SYCL وخلفيات أخرى.