أصدر مشروع llama.cpp الإصدار 0.5.0، مع التركيز على أداء الخلفية، وتغطية أوسع للنماذج، وتشغيل خادم أكثر متانة. يقدم هذا التحديث دعمًا لهندسات جديدة مثل HRM-Text (DFM Mimir 1B) وMiMo-V2.6، بينما يعزز بشكل كبير الكفاءة الحسابية من خلال تحسينات CUDA وMetal.
- يسرع عمليات CUDA conv2d باستخدام GEMM الضمني.
- يضيف تحسينات دمج Metal MoE وSSM_CONV.
- يسمح للخادم بالارتباط بعناوين متعددة عبر عناوين TCP مفصولة بفواصل وأقمشة UNIX.
- يمكّن إخراج الصور من مكالمات الوظائف عن طريق إضافة دعم input_image.
- يحدث ggml إلى الإصدار v0.25.0، مما يوسع دعم الاتصال الفائق والانتباه السريع عبر الخلفيات.
يحسن هذا الإصدار الاستقرار للأطفال الذين تم إنشاؤهم بواسطة الموجه ويصلح عدة مشكلات في محلل الدردشة، مما يضمن تشغيلًا أكثر موثوقية للمستخدمين الذين ينشرون llama.cpp في بيئات الإنتاج.