أصدر مشروع llama.cpp الإصدار b10330، مقدمًا تحسينًا لـ CUDA يدمج عمليات rms_norm والضرب و RoPE في نواة واحدة. يرافق هذا التغيير فحوصات نطاق الذاكرة للعمليات المدمجة وحالات اختبار جديدة للأوزان البثية.

  • CUDA: دمج rms_norm + mul + rope (+ view + set_rows)
  • tests: إضافة حالة وزن بث إلى rms_norm_mul_rope
  • CUDA: فحص نطاقات الذاكرة قبل دمج rms_norm rope
  • CUDA: فحص نطاقات الذاكرة في دمج set_rows لـ rope

يوفر الإصدار ملفات ثنائية (binaries) لأنظمة macOS و Linux و Windows و Android و iOS عبر خلفيات عتادية مختلفة تشمل CPU و Vulkan و ROCm و OpenVINO و SYCL و HIP.