يُظهر مستخدم تشغيل نموذج Qwen3.6-35B-A3B المُكمَّم بـ NVFP4 على وحدة معالجة الرسومات RTX Pro 6000 Blackwell، محققًا حوالي 2000 توك/ث في إجمالي الإنتاجية أثناء التعامل مع 30 تدفقًا متزامنًا لتسمية الصور. تستخدم التكوين vLLM مع خلفية الانتباه FLASHINFER والتخزين المؤقت للبادئة لإدارة التزامن العالي. يُفعّل بنية مزيج الخبراء (MoE) فقط حوالي 53-61% من الخبراء حتى عند مستويات التزامن العالية، مما يسمح لها بالتفوق على النماذج الكثيفة رغم عددها الأكبر من المعاملات. يُثبت هذا الإعداد أن التكميم NVFP4 على عتاد Blackwell يمكنه التعامل بكفاءة مع أعباء العمل متعددة الوسائط مع توازٍ كبير دون استنفاد ذاكرة الفيديو (VRAM).
NVFP4 Qwen3.6-35B-A3B على Blackwell يحقق ~2000 توك/ث مع 30 تدفقًا متزامنًا
دمج GGUF وشوكة llama.cpp يمكّن الصوت والفيديو لـ Nemotron-3-Nano-Omni
يتناول المؤلف الفشل الصامت في الإصدارات الشائعة من GGUF الخاصة بـ Nemotron-3-Nano-Omni-30B، حيث تم تجاهل مدخلات الصوت والفيديو بسبب ملفات المشروع غير المكتملة ورسوم بيانية للاستدلال مفقودة. ولإصلاح ذلك، تم إصدار ملف mmproj موحد يحتوي على برج الرؤية، ومُشفّر الصوت FastConformer الكامل، ومُضمّن الفيديو الزمني جنبًا إلى جنب مع شوكة متخصصة من llama.cpp.
إضافة Nemotron 3.5 Lightning Omni القادر على العمل بدون أمثلة للرؤية والصوت عبر مطابقة الهندسة
قام المؤلف بإنشاء Nemotron 3.5 Lightning-Omni عن طريق ربط مشعّعات مُدرَّبة مسبقًا من Nemotron-3-Nano-Omni التابعة لـ NVIDIA بنموذج Nemotron 3.5 Lightning الخاص بالنص فقط، مما يتيح فهم الصور والصوت دون أي تدريب إضافي.
إنفيديا تقدم نموذج Qwen 3.8 2.4T على منصة GB300 NVL72 بسرعة 4K توكن/ثانية لكل وحدة معالجة رسومات
أظهرت إنفيديا تقديم نموذج المعلمات Qwen 3.8 2.4T مع قدرات استدلال قابلة للتكوين على منصة الأجهزة الخاصة بها GB300 NVL72.
مايكروسوفت تطلق Mage-VL، نموذجًا متعدد الوسائط للبث الأصلي المشفر
أطلقت مايكروسوفت Mage-VL، وهو نموذج أساسي متعدد الوسائط بكفاءة عالية يحتوي على 4 مليار معلمة لفهم الصور والفيديو، يعتمد على نهج مشفر أصلي لتبسيط المعالجة البصرية. يفصل النظام تدفقات الفيديو إلى إطارات مرجعية (I) وإطارات متوقعة (P)، مع الاحتفاظ فقط بالبقع التي تخصص لها المشفر بتات لتقليل استهلاك الرموز البصرية بنسبة تزيد عن 75%.
نموذج Qwen3.6-27B غير المُضبط يتفوق على Nemotron Puzzle-75B المُضبط في المهام الوكيلية
أظهرت تقييمات القدرات الوكيلية أن نموذج Qwen3.6-27B غير المُضبط أكمل بنجاح جميع المهام المختبرة باستخدام 6-9 استدعاءات للأدوات، بينما تطلب Nemotron Puzzle-75B المُضبط موجهات مُعدّة يدوياً وعدد دورات أكبر بكثير للنجاح.