قام مشروع llama.cpp بدمج تحديثات كبيرة لخلفيته OpenVINO، تركز بشكل أساسي على تمكين دعم عائلة نماذج Qwen3.5 وإدخال عدة تقنيات لتحسين استهلاك الذاكرة.

  • تمكين عمليات GPT-OSS MoE وMXFP4 وFILL وSIGMOID وSQR وSQRT وصفوف الأبعاد المتعددة.
  • إصلاح مشاكل الدقة في هياكل Gemma3n وPhi-3-mini (NEOX RoPE) وMPT وKimi-linear وMinimax-m3.
  • تنفيذ GGML_OPENVINO_RELEASE_WEIGHTS لتخفيض الذاكرة المستخدمة من قبل المضيف بعد الترجمة، مما يقلل استهلاك الذاكرة المستقر من حوالي 1555 ميجابايت إلى حوالي 710 ميجابايت للنموذج Llama-3.2-1B-Q4_K_M على وحدة الرسومات المتكاملة Arc.
  • إضافة إعادة كمّنة الأوزام البثية لتقليل ذروة الذاكرة المستخدمة أثناء الترجمة بمقدار 1.06 جيجابايت للنماذج ذات الحجم 1B و2.0 جيجابايت للنماذج ذات الحجم 8B.
  • إدخال ذاكرة تخزين مؤقت للنموذج من الواجهة الأمامية (GGML_OPENVINO_MODEL_CACHE_DIR) لتخطي تحويل الرسم البياني وترجمته عند التحميلات المتكررة.

تحسّن هذه التغييرات التوافق مع الهياكل الأحدث مثل Qwen3.5 وتقلل بشكل كبير من كل من بصمة الذاكرة العابرة أثناء الترجمة والاستقرار أثناء الاستدلال على وحدة معالجة الرسومات.