llama.cpp प्रोजेक्ट ने Kimi-K3 टेक्स्ट मॉडल के लिए समर्थन जोड़ा है, जिसमें पुराने Kimi-Linear-48B में मौजूद न होने वाले पांच विशिष्ट आर्किटेक्चरल फीचर्स के साथ इसकी हाइब्रिड KDA (लीनियर) + MLA (फुल) एटेंशन आर्किटेक्चर को लागू किया गया है।
- इसमें क्रॉस-लेयर रिसिडुअल एटेंशन, लैटेंट MoE, SwiGLU को प्रतिस्थापित करने वाला स्थितिजन्य सक्रियण, एक MLA आउटपुट गेटिंग, और फुल-रैंक KDA गेटिंग शामिल है।
- रूटेड एक्सपर्ट्स "mxfp4-pack-quantized" फॉर्मेट का उपयोग करके कंप्रेस्ड-टेंसर के रूप में भेजे जाते हैं, जो ggml के MXFP4 के साथ बिट-कम्पैटिबल है ताकि डीक्वांटीज़ेशन के बिना हानिरहित पुनर्पैकिंग संभव हो सके।
- एक नया चैट टेम्पलेट तर्क, सामग्री और टूल कॉल्स के लिए Kimi-K3 के XTML-ish टैग्ड फॉर्मेट को संभालता है, जिसमें विशिष्ट संदेश विभाजक और टोकन-स्तर स्प्लिटिंग शामिल हैं।
- कन्वर्टर में टाइप त्रुटियों को ठीक किया गया है और LLAMA_MAX_EXPERTS को 512 से बढ़ाकर 1024 कर दिया गया है, जबकि मॉडल सेवर अब राउंडट्रिप फिडेलिटी बनाए रखने के लिए kda_gate_lower_bound पैरामीटर को सही ढंग से उत्सर्जित करता है।
इस अपडेट के उपयोगकर्ता Moonshot के रेफरेंस इम्प्लीमेंटेशन और वास्तविक जनरेशन डेटा के खिलाफ सत्यापित एंड-टू-एंड सटीकता के साथ स्थानीय रूप से Kimi-K3 को चला सकते हैं।