llama.cpp 0.3.0 ने DSA-ISWA KV कैश प्रकार के साथ dots3-note बहु-मोडल मॉडल के लिए समर्थन, GLM-4.5-Air के लिए बहु-टोकन पूर्वानुमान (MTP) समर्थन पेश किया है। इस रिलीज़ में DeepSeek 4 के लिए tensor-split क्षमताएं भी जोड़ी गई हैं और बहु-क्रम रोलबैक समस्याओं को ठीक किया गया है।
- ggml को v0.22.0 पर अपग्रेड किया गया है, जिसमें meta-backend और per-op Metal kernels के लिए समानांतर संकलन के साथ tensor-split समर्थन जोड़ा गया है।
- mtmd में dots3-note विज़न/ऑडियो समर्थन, ffmpeg के माध्यम से WebP डिकोडिंग, और Pillow-सटीक रीज़ाइज एल्गोरिदम प्राप्त हुआ है।
- DeepSeek 4 को `-sm tensor` फ्लैग के माध्यम से tensor-split मोड मिला है और बहु क्रमों के साथ रोलबैक के लिए ठीक किया गया है।
- सर्वर में `LLAMA_SERVER_SLOTS_N_DIFF` डीबग नॉब जोड़ा गया है, जबकि वेब UI में टैब्ड चैट नेविगेशन प्राप्त हुआ है।
यह अपडेट llama.cpp की बहु-मोडल क्षमताओं को विस्तारित करता है और DeepSeek 4 और GLM-4.5-Air जैसी विशिष्ट मॉडल आर्किटेक्चर के लिए प्रदर्शन और स्थिरता में सुधार करता है।