أصدرت مكتبة MLX الإصدار 0.32.1، مقدمةً دعمًا لبعد رأسي يبلغ 72 ضمن تنفيذ الانتباه الكامل لـ Metal.
- يتيح التحديث استخدام البعد الرأسي 72 في الانتباه الكامل لـ Metal عبر طلب السحب #4330.
أصدرت مكتبة MLX الإصدار 0.32.1، مقدمةً دعمًا لبعد رأسي يبلغ 72 ضمن تنفيذ الانتباه الكامل لـ Metal.
أطلقت Apple بنية جديدة لنماذجها الأساسية من الجيل الثالث (AFM3) تستخدم "تقليم اتباع التعليمات" لتقليل عدد المعاملات النشطة بشكل كبير. تم تصميم النموذج لتفعيل حوالي 20% من طبقات MLP الخاصة به عن طريق اتخاذ قرارات التوجيه مرة واحدة لكل طلب بدلاً من كل توكن.
تجري آبل حالياً محادثات مع الشركة الناشئة بريزم إل إيه (PrismML) بشأن تقنية تضغط نماذج الذكاء الاصطناعي لنشرها على أجهزة آيفون.
أصدرت مكتبة MLX الإصدار 0.32.0، الذي يعالج خطأً محدداً في الخلفية (backend) الخاصة بـ Metal.
يقدم الباحثون BaseRT، وهو وقت تشغيل للاستدلال باستخدام Metal الأصلي للنماذج اللغوية الكبيرة على شرائح Apple Silicon، يحقق أعلى معدل استدلال مُبلغ عنه حتى الآن. ومن خلال الاستفادة من دمج النوى الخاص بالشريحة والتحسين الواعي للذاكرة الموحدة، يتغلب على الحمل الزائد الموجود في الأطر الحالية مثل llama.cpp وMLX.
تم تقييم مُخصِّص وحدة معالجة الرسومات الواعي بالقيود مقابل مجدول قائمة الانتظار الأولى عبر سبعة سيناريوهات، محققاً زيادة تصل إلى 33 نقطة مئوية في استغلال وحدة معالجة الرسومات و105% أكثر من الإخراج المرجّح بالأولوية على نفس العتاد. يعالج النظام طلب الاستدلال في الوقت الفعلي كمنحنٍ متذبذب بدلاً من حجز ثابت، مما يسمح للوظائف الشبيهة بالحزم بملء السعة خلال فترات الانخفاض مع احترام القيود الصارمة مثل كتل وحدة معالجة الرسومات المتصلة وعدم إمكانية الإيقاف المؤقت.
نستخدم ملفات تعريف الارتباط لقياس الزيارات وتحسين الموقع. يمكنك قبول أو رفض ملفات تعريف الارتباط الخاصة بالتحليلات. سياسة الخصوصية