تدعم الآن مكتبة Transformers التابعة لـ Hugging Face تحميل النماذج المُكمّمة بتنسيق GGUF، مستفيدةً من نوى ggml الأساسية لتحقيق أداء يقترب من llama.cpp. يتيح هذا التكامل للمطورين تشغيل نقاط التفتيش المُكمّمة مباشرةً داخل واجهة برمجة التطبيقات القياسية المعتمدة على PyTorch على الأجهزة المدعومة.

  • يركز التوافق في البداية على الاستدلال المحلي لأجهزة Apple Silicon، بدءًا من بنية Qwen3.5.
  • يعيد التنفيذ استخدام نوى ggml Metal عبر مكتبة النوى الجديدة ويقلل الحمل الزائد في دالة generate.
  • يمكن للمستخدمين تحميل نماذج GGUF عن طريق تمرير معرف النموذج واسم الملف من Hub إلى from_pretrained دون إعدادات إضافية.
  • تكشف أمر transformers serve عن واجهة برمجة التطبيقات المتوافقة مع OpenAI لخدمة هذه النماذج.
  • أظهرت الاختبارات على MacBook Pro M2 Max أن Transformers يؤدي أداءً يقترب من llama.cpp عبر نقاط التفتيش الكثيفة ومزيج الخبراء.

يقترب هذا التكامل من أساس تعريف النموذج في Transformers إلى أساس الاستدلال المحلي في llama.cpp، مما يمكّن المطورين من تجربة نماذج GGUF باستخدام أدوات PyTorch المألوفة للفحص والتقييم والضبط الدقيق.