Hugging Face की Transformers लाइब्रेरी अब GGUF क्वांटाइज्ड मॉडल लोड करने का समर्थन करती है, जिसमें llama.cpp के निकट प्रदर्शन लाने के लिए underlying ggml kernels का उपयोग किया गया है। इस एकीकरण से डेवलपर्स को समर्थित हार्डवेयर पर मानक PyTorch-आधारित API के भीतर ही क्वांटाइज्ड चेकपॉइंट्स चلانے की सुविधा मिलती है।
- संगतता का प्रारंभिक ध्यान Apple Silicon के लिए स्थानीय निष्पादन पर है, जो Qwen3.5 आर्किटेक्चर से शुरू होता है।
- नई kernels लाइब्रेरी के माध्यम से ggml Metal kernels को पुन: उपयोग करने और generate फ़ंक्शन में ओवरहेड कम करने का कार्यान्वयन किया गया है।
- उपयोगकर्者们 बिना अतिरिक्त कॉन्फ़िगरेशन के from_pretrained में Hub मॉडल ID और फ़ाइल नाम पास करके GGUF मॉडल लोड कर सकते हैं।
- transformers serve कमांड इन मॉडल को सर्व करने के लिए एक OpenAI-संगत API प्रदर्शित करता है।
- MacBook Pro M2 Max पर किए गए बेंचमार्क्स में दिखाया गया है कि Transformers, घन और मिक्स्चर-ऑफ़-एक्सपर्ट्स चेकपॉइंट्स दोनों में llama.cpp के निकट प्रदर्शन प्रदान करता है।
यह एकीकरण Transformers की मॉडल परिभाषा आधार को llama.cpp के स्थानीय निष्पादन आधार के करीब लाता है, जिससे डेवलपर्स जाँच, मूल्यांकन और फाइन-ट्यूनिंग के लिए परिचित PyTorch टूल्स का उपयोग करते हुए GGUF मॉडल पर प्रयोग कर सकते हैं।