أصدر مشروع llama.cpp الإصدار b10142، الذي يقدم دعماً أولياً للرؤية لنموذج MiniMax-M3. يطبق هذا التحديث نسخة تعتمد على النص فقط وتعيد استخدام المكونات الموجودة من MiniMax-M2، بما في ذلك GQA مع تطبيع QK لكل رأس ودوران جزئي، وخبراء بأسلوب DeepSeek-V3، وتنشيط swigluoai.

  • تتضمن التنفيذ برج رؤية MiniMax-M3 (mmproj + رسم clip) مع إزالة رؤوس MTP ودعم الانتباه المتناثر.
  • تشمل تحسينات الأداء تفكيك عمليات وحدة المعالجة المركزية البطيئة إلى عمليات GPU/CPU لتحقيق تسريعات هائلة في السياقات الطويلة، وإعادة كتابة عملية الفهرسة لتكون أصلية لـ CUDA.
  • يقلل المسار الموحد 4-way + decode من عدد العقد لكل طبقة من حوالي 50 إلى حوالي 25، مما يقلل من مخازن الحساب بنسبة تقارب 20%.
  • تظهر القياسات زيادة سرعات فك التشفير من 6.2–7.15 t/s إلى 7.7–7.8 t/s في إعدادات إخراج الخبراء، مع تسريع عملية الحشو بمقدار حوالي 10%.

يجب إعادة إنشاء جميع ملفات GGUF المولدة قبل هذا التغيير لضمان التوافق مع البنية الجديدة ومنطق التحويل.