Un utilisateur démontre l'exécution du modèle Qwen3.6-35B-A3B quantisé en NVFP4 sur un GPU RTX Pro 6000 Blackwell, atteignant environ 2000 tokens par seconde de débit agrégé tout en gérant 30 flux simultanés de légende d'image. La configuration utilise vLLM avec le backend d'attention FLASHINFER et la mise en cache des préfixes pour gérer une forte concurrence. L'architecture Mixture of Experts (MoE) n'active que environ 53-61% des experts même à des niveaux de concurrence élevés, lui permettant de surpasser les modèles denses malgré son plus grand nombre de paramètres. Cet agencement prouve que la quantification NVFP4 sur le matériel Blackwell peut gérer efficacement des charges de travail multimodales avec une parallélisation significative sans épuiser la VRAM.
NVFP4 Qwen3.6-35B-A3B sur Blackwell atteint ~2000 tps avec 30 flux simultanés
Un GGUF unifié et un fork de llama.cpp permettent l'audio et la vidéo pour Nemotron-3-Nano-Omni
L'auteur traite des échecs silencieux dans les versions populaires de Nemotron-3-Nano-Omni-30B au format GGUF, où les entrées audio et vidéo étaient ignorées en raison de fichiers projecteurs incomplets et de graphes d'inférence manquants. Pour résoudre ce problème, un fichier mmproj unifié contenant la tour visuelle, l'encodeur audio Parakeet/FastConformer complet et l'intégrateur vidéo temporel a été publié aux côtés d'un fork spécialisé de llama.cpp.
Zero-shot Nemotron 3.5 Lightning Omni ajoute la vision et l'audio via une correspondance géométrique
L'auteur a créé Nemotron 3.5 Lightning-Omni en attachant des projecteurs pré-entraînés de Nemotron-3-Nano-Omni de NVIDIA au modèle textuel uniquement Nemotron 3.5 Lightning, permettant la compréhension d'images et d'audio sans aucun entraînement supplémentaire.
NVIDIA sert Qwen 3.8 2.4T sur GB300 NVL72 à 4K tok/s par GPU
NVIDIA a démontré le service du modèle de paramètres Qwen 3.8 2.4T avec des capacités de raisonnement configurables sur sa plateforme matérielle GB300 NVL72.
Microsoft publie Mage-VL, un modèle multimodal en streaming natif par codec
Microsoft a publié Mage-VL, un modèle de base multimodal efficace de 4 milliards de paramètres pour la compréhension d'images et de vidéos, qui utilise une approche native par codec pour rationaliser le traitement visuel. Le système sépare les flux vidéo en images ancrées (I) et images prédites (P), ne conservant que les patches où le codec alloue des bits afin de réduire la consommation de tokens visuels de plus de 75 %.
Qwen3.6-27B non ajusté surpasse Nemotron Puzzle-75B ajusté dans les tâches agentic
Une évaluation des capacités agentic montre que le modèle Qwen3.6-27B non ajusté a réussi à compléter toutes les tâches testées en utilisant 6 à 9 appels d'outils, tandis que le Nemotron Puzzle-75B ajusté nécessitait des prompts manuellement ajustés et significativement plus de tours pour réussir.