llama.cpp v0.6.0 मिश्रित टोकन और एम्बेडिंग इनपुट के लिए नया llama_batch_ext विस्तृत बैच API पेश करता है, साथ ही GLM-5.3-Flash 320B हाइब्रिड मॉडल और Clef निर्णय मॉडल का समर्थन भी।
- नया llama_batch_ext API MTP और deepstack मॉडल्स के लिए प्रति-टोकन स्टेट एम्बेडिंग का समर्थन करता है।
- Qwen4Exp अब MTP स्पेकुलेटिव डिकोडिंग के साथ उच्च गुणवत्ता वाला समर्थन प्रदान करता है, जिससे DGX Spark पर लगभग 1.5x डिकोड गति में वृद्धि होती है।
- एक नया /v1/systemone सर्वर API पांच निर्णय मॉडल्स का समर्थन करता है: laya, julia-1, lev, openjev और kev।
- Metal को Apple GPU पर F16 KV और MMA mat-mul kernels के लिए 3x तक तेज tensor-API फ्लैश एटेंशन kernel प्राप्त होता है।
- Web UI में Hugging Face Hub डेटा परत और मॉडल डाउनलोड पाइपलाइन के साथ एक बड़ा अद्यतन किया गया है।
यह रिलीज मल्टीमोडल प्रोसेसिंग, स्पेकुलेटिव डिकोडिंग प्रदर्शन और निर्णय मॉडल एकीकरण के लिए llama.cpp की क्षमताओं का विस्तार करती है।