llama.cpp परियोजना ने बिल्ड b10142 जारी किया, जिसमें MiniMax-M3 मॉडल के लिए विजन का प्रारंभिक समर्थन शामिल है। यह अपडेट एक पाठ-केवल पोर्ट लागू करता है जो मौजूदा घटकों को पुन: उपयोग करता है, जिनमें GQA (प्रत्येक हेड QK-norm और आंशिक रोटरी के साथ), DeepSeek-V3 शैली के एक्सपर्ट्स, और swigluoai सक्रियण शामिल हैं।
- इस कार्यान्वयन में MiniMax-M3 विजन टावर (mmproj + clip ग्राफ) शामिल है, जबकि MTP हेड्स और स्पार्स एटेंशन समर्थन हटा दिया गया है।
- प्रदर्शन अनुकूलनों में धीमे CPU ऑपरेशन को GPU/CPU ऑप्स में विघटित करना (लंबे संदर्भों पर भारी गति वृद्धि के लिए) और इंडेक्सर ऑप को CUDA नेटिव बनाना शामिल है।
- एक एकीकृत 4-वे + डिकोड पथ से प्रत्येक लेयर में नोड्स की संख्या ~50 से घटकर ~25 हो गई, जिससे कंप्यूट बफर्स लगभग 20% छोटे हो गए।
- मापन प्रभावों के अनुसार, एक्सपर्ट ऑफलोड सेटअप पर डिकोड गति 6.2–7.15 t/s से बढ़कर 7.7–7.8 t/s हो गई है, और प्रिफिल लगभग 10% तेज हो गया है।
इस परिवर्तन से पहले उत्पन्न किए गए सभी GGUF को नई आर्किटेक्चर और रूपांतरण तर्क के साथ संगतता सुनिश्चित करने के लिए पुनः उत्पन्न करना आवश्यक है।