أصدر مشروع llama.cpp الإصدار b10782، الذي يعالج مشكلة حرجة في الخلفية (backend) الخاصة بـ CUDA لإعدادات وحدات المعالجة الرسومية المتعددة. يتيح التحديث تدفقات متزامنة لكل تقسيم ويمكّن تحسين الرسوم البيانية لـ CUDA من العمل بشكل صحيح عبر أجهزة متعددة.

  • إصلاح خطأ كان فيه أحداث CUDA مربوطة بشكل غير صحيح إلى وحدة المعالجة الرسومية النشطة أثناء الإنشاء، مما يتسبب في تخطي تحسين الرسوم البيانية لعدة وحدات معالجة رسومية.
  • تنفيذ تعيين الجهاز صراحةً عبر `ggml_cuda_set_device` لضمان تطبيق التحسينات على التقسيم الصحيح لكل جهاز.
  • الإصلاح نشط فقط عندما يكون `GGML_CUDA_GRAPH_OPT=1` مفعّلاً؛ يبقى السلوك الافتراضي دون تغيير.

يضمن هذا التغيير أن يعمل تحسين الرسوم البيانية مرة واحدة لكل تقسيم بدلاً من تخطيه، مما يسمح للاستدلال على عدة وحدات معالجة رسومية باستخدام تسريع CUDA بشكل صحيح.