يقدم إصدار llama.cpp 0.4.0 دعمًا أوليًا للهيكلية لنموذجي Qwen3.8-Flash-Next و NVIDIA Nemotron-3-Puzzle-75B-A9B، جنبًا إلى جنب مع تحديث مكتبة ggml الأساسية إلى الإصدار 0.23.0.
- تمت إضافة القراءة الكسولة للزوايا عند الطلب وحدود سياق الخادم لكل فتحة.
- تم تحديث ggml إلى الإصدار 0.23.0 مع دعم الانتباه السريع المتناثر ونقل Apple RDMA.
- تم إدخال خيارات إدخال الفيديو، والبحث عن تاريخ n-gram، وقيود ذاكرة الوصول العشوائي للمُكمِّم.
- تم تمكين `preserve_reasoning` بشكل افتراضي في الخادم وتحسين مساعدات الترميز متعدد الوسائط.
توسع هذه التغييرات من توافق النموذج وتوفر للمطورين تحكمًا أدق في استخدام الذاكرة وتخصيص موارد الخادم.