एक उपयोगकर्ता RTX Pro 6000 Blackwell GPU पर NVFP4-क्वांटाइज्ड Qwen3.6-35B-A3B मॉडल चलाने का प्रदर्शन करता है, जिसमें 30 समानांतर इमेज कैप्शनिंग स्ट्रीम्स को संभालते हुए कुल थ्रूपुट में लगभग प्रति सेकंड 2000 टोकन प्राप्त होता है। उच्च समानांतरता को प्रबंधित करने के लिए कॉन्फ़िगरेशन vLLM का उपयोग FLASHINFER एटेंशन बैकएंड और प्रीफ़िक्स कैशिंग के साथ करता है। हाई समानांतरता स्तरों पर भी मिक्स्चर ऑफ एक्सपर्ट्स (MoE) आर्किटेक्चर केवल लगभग 53-61% एक्सपर्ट्स को सक्रिय करता है, जिससे यह अपने बड़े पैरामीटर गिनती के बावजूद घन मॉडल से बेहतर प्रदर्शन करता है। यह सेटअप साबित करता है कि Blackwell हार्डवेयर पर NVFP4 क्वांटाइज़ेशन महत्वपूर्ण समानांतरता के साथ बहुआयामी कार्यभार को कुशलता से संभाल सकता है बिना VRAM को खत्म किए।
30 समानांतर स्ट्रीम्स के साथ Blackwell पर NVFP4 Qwen3.6-35B-A3B लगभग ~2000 tps प्राप्त करता है
एकीकृत GGUF और llama.cpp फ़ॉर्क नेमोट्रॉन-3-नैनो-ऑम्नी के लिए ऑडियो और वीडियो सक्षम करते हैं
लेखक नेमोट्रॉन-3-नैनो-ऑम्नी-30B के लोकप्रिय GGUF संस्करणों में मौन विफलताओं पर प्रकाश डालते हैं, जहाँ अपूर्ण प्रोजेक्टर फ़ाइलों और अनुपस्थित इनफरेंस ग्राफ़्स के कारण ऑडियो और वीडियो इनपुट को नज़रअंदाज कर दिया गया था। इस समस्या को हल करने के लिए, विजन टावर, पूर्ण Parakeet/FastConformer ऑडियो एन्कोडर और टेम्पोरल वीडियो एम्बेडर को एक ही फ़ाइल में समेटने वाला एक एकीकृत mmproj फ़ाइल विशेष llama.cpp फ़ॉर्क के साथ जारी की गई है।
जीरो-शॉट नेमोट्रॉन 3.5 लाइटनिंग ओमी में ज्यामितीय मिलान के माध्यम से दृष्टि और ऑडियो का योग
लेखक ने टेक्स्ट-केवल नेमोट्रॉन 3.5 लाइटनिंग मॉडल में NVIDIA के नेमोट्रॉन-3-नाનો-ओमी से पूर्व-प्रशिक्षित प्रोजेक्टर्स को जोड़कर नेमोट्रॉन 3.5 लाइटनिंग-ओमी बनाया है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के छवि और ऑडियो समझ संभव हुई।
NVIDIA ने GB300 NVL72 पर Qwen 3.8 2.4T को प्रति GPU 4K टोकन/स की गति से सर्व किया
NVIDIA ने अपनी GB300 NVL72 हार्डवेयर प्लेटफॉर्म पर कॉन्फ़िगर करने योग्य तर्क क्षमताओं के साथ Qwen 3.8 2.4T पैरामीटर मॉडल को सर्व करते हुए प्रदर्शन किया।
माइक्रोसॉफ्ट ने मैज-वीएल जारी किया, एक कोडेक-नेटिव स्ट्रीमिंग मल्टीमोडल मॉडल
माइक्रोसॉफ्ट ने मैज-वीएल जारी किया है, जो छवि और वीडियो समझ के लिए एक कुशल 4B-पैरामीटर मल्टीमोडल फाउंडेशन मॉडल है जो दृश्य प्रसंस्करण को सरल बनाने के लिए एक कोडेक-नेटिव दृष्टिकोण का उपयोग करता है। सिस्टम वीडियो स्ट्रीम को एंकर (I) फ्रेम और पूर्वानुमानित (P) फ्रेम में अलग करता है, केवल उन पैच को बनाए रखता है जहां कोडेक बिट्स आवंटित करता है, जिससे दृश्य टोकन की खपत 75% से अधिक कम हो जाती है।
अजस्ट किए गए Nemotron Puzzle-75B की तुलना में अजस्ट किए गए Qwen3.6-27B ने एजेंटिक टास्क में बेहतर प्रदर्शन किया
एजेंटिक क्षमताओं का मूल्यांकन दिखाता है कि अजस्ट किए गए Qwen3.6-27B मॉडल ने 6-9 टूल कॉल्स का उपयोग करके सभी परीक्षण टास्क सफलतापूर्वक पूरे किए, जबकि अजस्ट किए गए Nemotron Puzzle-75B को पास करने के लिए हैंड-ट्यूडेड प्रॉम्प्ट और काफी अधिक टर्न की आवश्यकता थी।