أصدر مشروع llama.cpp الإصدار b11227، الذي يتضمن تحسينات للأداء تستهدف بشكل خاص التعامل مع العلم `causal_attn` أثناء المعالجة متعددة الوسائط.

  • لم يعد المجدول يعيد حجز الذاكرة عند تبديل `causal_attn`، مما يلغي العمليات المكلفة التي كانت تبطئ المدخلات البصرية للنماذج مثل Gemma.
  • أصبح شكل الانحرم لمؤشر qwen4exp الآن مستقلاً عن `causal_attn`، مما يمنع فشل إعادة تخصيص المخزن المؤقت تحت قيود `GGML_SCHED_NO_REALLOC`.
  • أظهرت الاختبارات على llama-server مع gemma-4-26B-A4B انخفاضاً كبيراً في زمن الوصول، مثل تسريع بنسبة 7.61x لـ 24 صورة على RTX 4090 ووصولاً إلى 3.40x على H200 مع إعدادات سياق كبيرة.

تحسّن هذه التغييرات سرعة الاستدلال لإدخالات الصور المتعددة والفيديو دون تغيير المخرجات المولدة أو سلوك إعادة بناء الرسم البياني.