توضح مقترح على منتديات Hugging Face طبقة مشتركة لتنفيذ وحدات معالجة الرسومات وإدارة الذاكرة مصممة لفصل كود التطبيق عن بائعي الأجهزة المحددين مثل NVIDIA وAMD وIntel. الهدف هو السماح للمستخدمين بتحديد ميزانية ذاكرة بدلاً من تكوين أعلام خاصة بالخلفية الخلفية، أو خرائط الأجهزة، أو استراتيجيات الإخراج يدوياً.

  • سيحدد وقت التشغيل تلقائياً وضع الطبقات، واختيار الدقة (INT4، INT8، FP8)، وإدارة ذاكرة التخزين المؤقت KV بناءً على VRAM المتاح.
  • يقدم نموذج ذاكرة هرمية مع طبقات لـ VRAM المحلي لوحدة معالجة الرسومات، والذاكرة الموسعة، وRAM النظام، وتخزين NVMe.
  • تُقترح أنواع البيانات منخفضة البت كميزات رئيسية لوقت التشغيل لمنع مخازن إعادة التكميم من إبطال فوائد التكميم.
  • تهدف الهندسة المعمارية إلى جعل استنتاج INT4 من فئة 13B عملياً على وحدات معالجة الرسومات الاستهلاكية بسعة 12 جيجابايت من خلال التحكم في البصمة الكاملة لوقت التشغيل للذاكرة.

تسعى هذه النهج لمعالجة التوافق البرمجي المجزأ وقيود VRAM، مما يتيح للأحمال العملية للذكاء الاصطناعي العمل بكفاءة عبر أسواق وحدات معالجة الرسومات متعددة البائعين دون الحاجة إلى اقتران وثيق بـ CUDA أو الخلفيات الخاصة بالبائع.