Seorang pengguna mendemonstrasikan menjalankan model Qwen3.6-35B-A3B yang dikuantisasi NVFP4 pada GPU RTX Pro 6000 Blackwell, mencapai sekitar 2000 token per detik dalam throughput agregat sambil menangani 30 aliran captioning gambar simultan. Konfigurasi ini memanfaatkan vLLM dengan backend perhatian FLASHINFER dan caching awalan untuk mengelola konkurensi tinggi. Arsitektur Mixture of Experts (MoE) hanya mengaktifkan sekitar 53-61% ahli bahkan pada tingkat konkurensi tinggi, memungkinkannya mengungguli model padat meskipun memiliki jumlah parameter yang lebih besar. Pengaturan ini membuktikan bahwa kuantisasi NVFP4 pada perangkat keras Blackwell dapat menangani beban kerja multimodal dengan paralelisme signifikan secara efisien tanpa menghabiskan VRAM.
NVFP4 Qwen3.6-35B-A3B di Blackwell mencapai ~2000 tps dengan 30 aliran simultan
GGUF terpadu dan fork llama.cpp mengaktifkan audio dan video untuk Nemotron-3-Nano-Omni
Penulis menangani kegagalan diam pada versi GGUF populer dari Nemotron-3-Nano-Omni-30B, di mana input audio dan video diabaikan karena file projector yang tidak lengkap dan grafik inferensi yang hilang. Untuk memperbaikinya, file mmproj terpadu yang berisi menara visi, encoder audio Parakeet/FastConformer penuh, dan penanam video temporal telah dirilis bersama fork llama.cpp khusus.
Nemotron 3.5 Lightning Omni zero-shot menambahkan visi dan audio melalui kecocokan geometri
Penulis telah membuat Nemotron 3.5 Lightning-Omni dengan menempelkan projector pra-latihan dari NVIDIA’s Nemotron-3-Nano-Omni ke model teks-saja Nemotron 3.5 Lightning, memungkinkan pemahaman gambar dan audio tanpa pelatihan tambahan.
NVIDIA melayani Qwen 3.8 2.4T di GB300 NVL72 pada 4K tok/s per GPU
NVIDIA telah mendemonstrasikan layanan model parameter Qwen 3.8 2.4T dengan kemampuan penalaran yang dapat dikonfigurasi pada platform perangkat keras GB300 NVL72-nya.
Microsoft merilis Mage-VL, model multimodal streaming asli codec
Microsoft telah merilis Mage-VL, model dasar multimodal 4B-parameter yang efisien untuk pemahaman gambar dan video yang menggunakan pendekatan asli codec untuk menyederhanakan pemrosesan visual. Sistem ini memisahkan aliran video menjadi frame jangkar (I) dan frame prediksi (P), hanya mempertahankan patch di mana codec mengalokasikan bit untuk mengurangi konsumsi token visual lebih dari 75%.
Qwen3.6-27B yang tidak dituning mengungguli Nemotron Puzzle-75B yang dituned dalam tugas agentic
Evaluasi kemampuan agentic menunjukkan bahwa model Qwen3.6-27B yang tidak dituned berhasil menyelesaikan semua tugas yang diuji menggunakan 6-9 panggilan alat, sedangkan Nemotron Puzzle-75B yang dituned memerlukan prompt yang disesuaikan secara manual dan jumlah giliran yang jauh lebih banyak untuk lulus.