NVIDIA ha lanzado el modelo Nemotron-TwoTower-30B-A3B-Base-BF16, que se basa en la arquitectura principal Nemotron 3 Nano 30B-A3B. Esta arquitectura difiere de los modelos autoregresivos estándar al utilizar una torre de contexto congelada junto con una torre de denoising por difusión. El sistema llena iterativamente bloques de tokens en paralelo en lugar de generarlos estrictamente uno a la vez. Según NVIDIA, esta configuración predeterminada de máscara-difusión conserva el 98.7% de la calidad agregada de las pruebas de referencia encontrada en la línea base autoregresiva. A pesar de mantener una alta calidad, el modelo logra 2.42 veces su rendimiento de generación en tiempo real. El lanzamiento destaca un enfoque novedoso para el modelado de lenguaje que combina técnicas de difusión con capacidades de lenguaje a gran escala.
NVIDIA lanza Nemotron-TwoTower-30B-A3B, un modelo de lenguaje basado en difusión
llama.cpp añade soporte para NVIDIA Nemotron-3-Puzzle-75B-A9B
llama.cpp introduce soporte para el modelo NVIDIA Nemotron-3-Puzzle-75B-A9B, habilitando la inferencia para esta arquitectura de Mezcla de Expertos. La actualización implementa infraestructura para tamaños de alimentación hacia adelante de expertos por capa variables y enrutamiento top-k, que son necesarios porque el modelo tiene 40 capas MoE con valores distintos de n_ff_exp y top-k.
LordNeel lanza cuantizaciones GGUF para Tencent Hy3 y NVIDIA Nemotron-Labs-Audex
LordNeel ha publicado conjuntos de cuantización GGUF para el modelo MoE Hy3 de 295B de Tencent y el modelo híbrido MoE Nemotron-Labs-Audex-30B-A3B de 30B con capacidades de audio de NVIDIA, proporcionando datos completos de benchmarks y métricas reproducibles.
NVIDIA lanza Puzzle-75B-A9B, un modelo Nemotron comprimido con 2x de rendimiento
NVIDIA ha lanzado el modelo Nemotron-Labs-3-Puzzle-75B-A9B, un modelo de lenguaje grande optimizado para despliegue derivado de Nemotron-3-Super-120B-A12B. Utiliza el marco de compresión post-entrenamiento Iterative Puzzle para mejorar significativamente la eficiencia de inferencia en cargas de trabajo con razonamiento y contexto largo, manteniendo una alta precisión en tareas posteriores.
NVIDIA lanza el modelo Qwen3.6-27B-NVFP4
NVIDIA ha lanzado el modelo Qwen3.6-27B-NVFP4 en Hugging Face.
GLM-5.2 en 4x DGX Spark: Reconstrucción de pasos de compilación faltantes para descodificación especulativa MTP
El autor implementó con éxito GLM-5.2 con descodificación especulativa MTP en un clúster de cuatro nodos NVIDIA GB10 (DGX Spark), alcanzando aproximadamente 9.4 tokens por segundo. Esta configuración utiliza vLLM con paralelismo de tensor, kernels Triton sparse-MLA portados y una poda determinista del 15% de expertos para ajustar los pesos AWQ-INT4. Un hallazgo crítico es que las instrucciones originales de construcción de la imagen Docker están incompletas, requiriendo la reconstrucción de parches faltantes para deep_gemm.py y sparse_attn_indexer.py. El autor también identificó que usar cualquier versión de vLLM distinta al commit específico fijado provoca que los pesos AWQ reales fallen durante la carga debido a errores de CUDA. Para replicar el entorno, los usuarios deben aplicar un script personalizado que incorpore kernels y funciones de enrutamiento a fallbacks sm12x. Los beneficios de rendimiento incluyen aproximadamente el doble de velocidad de las implementaciones anteriores de llama.cpp, aunque el ancho de banda entre nodos sigue siendo un cuello de botella para la escalabilidad dual-rail.