يقدم إصدار llama.cpp 0.4.0 دعمًا أوليًا للهيكلية لنموذجي Qwen3.8-Flash-Next و NVIDIA Nemotron-3-Puzzle-75B-A9B، جنبًا إلى جنب مع تحديث مكتبة ggml الأساسية إلى الإصدار 0.23.0.

  • تمت إضافة القراءة الكسولة للزوايا عند الطلب وحدود سياق الخادم لكل فتحة.
  • تم تحديث ggml إلى الإصدار 0.23.0 مع دعم الانتباه السريع المتناثر ونقل Apple RDMA.
  • تم إدخال خيارات إدخال الفيديو، والبحث عن تاريخ n-gram، وقيود ذاكرة الوصول العشوائي للمُكمِّم.
  • تم تمكين `preserve_reasoning` بشكل افتراضي في الخادم وتحسين مساعدات الترميز متعدد الوسائط.

توسع هذه التغييرات من توافق النموذج وتوفر للمطورين تحكمًا أدق في استخدام الذاكرة وتخصيص موارد الخادم.