يقدم المقال Quantization-Aware Healing، وهي طريقة لإنشاء نموذج مضغوط بدقة 4 بت يحقق أداءً متفوقًا على أصله الكامل الدقة.
يوضح هذا النهج أن تقنيات الكمّية المحددة يمكنها تعزيز قدرات النموذج بما يتجاوز النسخة الأساسية غير المكمّاة.
يقدم المقال Quantization-Aware Healing، وهي طريقة لإنشاء نموذج مضغوط بدقة 4 بت يحقق أداءً متفوقًا على أصله الكامل الدقة.
يوضح هذا النهج أن تقنيات الكمّية المحددة يمكنها تعزيز قدرات النموذج بما يتجاوز النسخة الأساسية غير المكمّاة.
أطلقت ميتا MobileMoE، وهي مجموعة من نماذج اللغة Mixture-of-Experts (MoE) للأجهزة المحمولة مصممة لتحسين مقايضة الجودة والكفاءة على الأجهزة المحمولة. تتضمن العائلة ثلاثة أحجام للنماذج مع معاملات نشطة أقل من مليار وبصمات وزن أقل من 3 جيجابايت بتنسيق INT4.
يقدم المؤلفون Quantization-Aware Healing (QAH)، وهو خط أنابيب يقوم بتقطيع طلاب 4 بت مباشرة من النماذج غير المضغوطة لاستعادة الأداء المفقود أثناء الضغط الهيكلي والتكميم. عند تطبيقه على GPT-OSS 120B، ينتج هذا الأسلوب Hypernova-60B، الذي يساوي أو يتفوق على المصدر bfloat16 في 7 من أصل 9 معايير مع استخدام حوالي 4 أضعاف أقل من ذاكرة الأوزان.
يقدم المؤلفون الشفاء الواعي للكمية (QAH)، وهي طريقة لاستعادة قدرات الاستدلال والبرمجة في نماذج اللغة الكبيرة المضغوطة هيكلياً بـ 4 بت. على عكس التدريب الواعي للكمية القياسي الذي يعيد ضبط النموذج المضغوط، يقوم QAH باستخلاص الطالب ذو الـ 4 بت مباشرة من النموذج الأصلي غير المضغوط.
قام Joakimpalm-Zen بتحديث Xyntetik Runner لتدريب محولات LoRA مباشرةً باستخدام نفس أوزان GGUF المُكمّاة التي يستخدمها للاستدلال، مما يلغي الحاجة إلى نسخة تدريب منفصلة بدقة FP16 أو وقت تشغيل مخصص.
أطلقت Liquid AI نقاط تفتيش لنماذج المسودة DSpark لثلاثة نماذج من عائلة LFM2.5: LFM2.5-1.2B-Instruct، وLFM2.5-2.6B، وLFM2.5-8B-A1B. تضيف هذه الموديلات المسودة مسار فك تشفير تخميني إلى النماذج المستهدفة الحالية، مما يتيح لموديل مسودة بحجم 300 مليون معامل تقريباً اقتراح كتلة من تسعة رموز مرشحة يتحقق منها النموذج المستهدف في تمرير أمامي واحد.
نستخدم ملفات تعريف الارتباط لقياس الزيارات وتحسين الموقع. يمكنك قبول أو رفض ملفات تعريف الارتباط الخاصة بالتحليلات. سياسة الخصوصية