Un usuario demuestra la ejecución del modelo Qwen3.6-35B-A3B cuantizado con NVFP4 en una GPU RTX Pro 6000 Blackwell, logrando aproximadamente 2000 tokens por segundo de throughput agregado mientras maneja 30 flujos concurrentes de generación de descripciones de imágenes. La configuración utiliza vLLM con el backend de atención FLASHINFER y caché de prefijos para gestionar la alta concurrencia. La arquitectura Mixture of Experts (MoE) activa solo alrededor del 53-61% de los expertos incluso a niveles altos de concurrencia, lo que le permite superar a los modelos densos a pesar de su mayor conteo de parámetros. Esta configuración demuestra que la cuantización NVFP4 en hardware Blackwell puede manejar eficientemente cargas de trabajo multimodales con paralelismo significativo sin agotar la VRAM.
NVFP4 Qwen3.6-35B-A3B en Blackwell alcanza ~2000 tps con 30 flujos concurrentes
La fusión unificada de GGUF y el fork de llama.cpp habilitan audio y vídeo para Nemotron-3-Nano-Omni
El autor aborda las fallas silenciosas en las versiones populares de GGUF de Nemotron-3-Nano-Omni-30B, donde las entradas de audio y vídeo eran ignoradas debido a archivos de proyección incompletos y gráficos de inferencia faltantes. Para solucionar esto, se ha publicado un archivo mmproj unificado que contiene la torre de visión, el codificador de audio Parakeet/FastConformer completo y el incrustador temporal de vídeo, junto con un fork especializado de llama.cpp.
Nemotron 3.5 Lightning Omni de cero disparos añade visión y audio mediante coincidencia geométrica
El autor ha creado Nemotron 3.5 Lightning-Omni adjuntando proyectores preentrenados de Nemotron-3-Nano-Omni de NVIDIA al modelo Nemotron 3.5 Lightning solo de texto, lo que permite la comprensión de imágenes y audio sin ningún entrenamiento adicional.
NVIDIA sirve Qwen 3.8 2.4T en GB300 NVL72 a 4K tokens/s por GPU
NVIDIA ha demostrado servir el modelo de parámetros Qwen 3.8 2.4T con capacidades de razonamiento configurables en su plataforma de hardware GB300 NVL72.
Microsoft lanza Mage-VL, un modelo multimodal de streaming nativo de códec
Microsoft ha lanzado Mage-VL, un modelo base multimodal eficiente de 4B de parámetros para la comprensión de imágenes y video que utiliza un enfoque nativo de códec para optimizar el procesamiento visual. El sistema separa los flujos de video en fotogramas ancla (I) y predichos (P), conservando solo los parches donde el códec asigna bits para reducir el consumo de tokens visuales en más del 75%.
Qwen3.6-27B sin ajustar supera a Nemotron Puzzle-75B ajustado en tareas de agente
Una evaluación de las capacidades de agente muestra que el modelo Qwen3.6-27B sin ajustar completó con éxito todas las tareas probadas utilizando 6-9 llamadas a herramientas, mientras que el Nemotron Puzzle-75B ajustado requirió prompts ajustados manualmente y significativamente más turnos para pasar.