أصدر مشروع llama.cpp الإصدار b10076، الذي يقدم تحسينًا للأداء في الخلفية CUDA عن طريق تعميم عملية `get_rows` باستخدام نسخ int4. يؤدي هذا التغيير إلى رفع العمل غير المتغير للصفوف خارج الحلقة لكل عنصر ويضيف مسارًا معمّمًا ينسخ 16 بايت لكل خيط للبيانات المتصلة من النوع نفسه.

يتم التحكم في التنفيذ عند وقت الترجمة وعند التشغيل، ويتطلب محاذاة بمقدار 16 بايت وشروط خطوة محددة لضمان الصحة. يمنع بوابة الإشغال التراجع في تجميعات الصف الواحد الصغيرة عن طريق إبقائها على المسار القياسي. على Strix Halo (gfx1151)، قلل هذا التحسين من زمن الانتظار لتجميع الحالة المتكررة DeltaNet من 18.6 ميكروثانية إلى 13.0 ميكروثانية.

يشمل الإصدار ملفات ثنائية لنظامي macOS وLinux وWindows وAndroid وopenEuler عبر خلفيات CPU وCUDA وROCm وVulkan وOpenVINO وSYCL وOpenCL.