llama.cpp संस्करण 0.4.0 ने Qwen3.8-Flash-Next और NVIDIA Nemotron-3-Puzzle-75B-A9B मॉडलों के लिए प्रारंभिक आर्किटेक्चर समर्थन पेश किया है, साथ ही underlying ggml लाइब्रेरी को संस्करण 0.23.0 पर अपडेट किया गया है।
- अनुरोध पर लेजी टेंसर रीडिंग और प्रति-स्लॉट सर्वर संदर्भ सीमाएँ जोड़ी गईं।
- ggml को 0.23.0 पर अपडेट किया गया, जिसमें स्पार्स फ्लैश एटेंशन और Apple RDMA ट्रांसपोर्ट समर्थन शामिल है।
- वीडियो इनपुट विकल्पों, n-ग्राम इतिहास खोज, और क्वांटाइजर RAM कैप्स पेश किए गए।
- सर्वर में `preserve_reasoning` को डिफ़ॉल्ट रूप से सक्षम किया गया और मल्टीमोडल टोकनाइज़ेशन हेल्पर्स को बेहतर बनाया गया।
इन बदलावों ने मॉडल संगतता का विस्तार किया है और डेवलपर्स को मेमोरी उपयोग और सर्वर संसाधन आवंटन पर अधिक नियंत्रण प्रदान किया है।