يقدم llama.cpp v0.6.0 واجهة برمجة التطبيقات الجديدة llama_batch_ext للدفعات الموسعة لإدخالات الرموز والميزات المدمجة المختلطة، بالإضافة إلى دعم النموذج الهجين GLM-5.3-Flash 320B ونموذج القرار Clef.
- تدعم واجهة برمجة التطبيقات الجديدة llama_batch_ext تضمينات الحالة لكل رمز لنماذج MTP وdeepstack.
- يقدم Qwen4Exp الآن دعماً عالي الجودة مع فك التشفير التخميني لـ MTP، مما يوفر تسريعاً في فك التشفير بنسبة 1.5x تقريباً على DGX Spark.
- تدعم واجهة برمجة التطبيقات الخادومية الجديدة /v1/systemone خمسة نماذج لاتخاذ القرار: laya وjulia-1 وlev وopenjev وkev.
- يكتسب Metal نواة انتباه flash لواجهة برمجة التطبيقات المصفوفية لـ F16 KV ونوى ضرب المصفوفات MMA الأسرع بثلاث مرات على وحدات معالجة الرسومات من Apple.
- يتلقى واجهة المستخدم عبر الويب تحديثاً شاملاً مع طبقة بيانات Hugging Face Hub وخط أنابيب تنزيل النماذج.
يوسع هذا الإصدار قدرات llama.cpp في المعالجة متعددة الوسائط، وأداء فك التشفير التخميني، وتكامل نماذج اتخاذ القرار.