El autor implementó con éxito GLM-5.2 con descodificación especulativa MTP en un clúster de cuatro nodos NVIDIA GB10 (DGX Spark), alcanzando aproximadamente 9.4 tokens por segundo. Esta configuración utiliza vLLM con paralelismo de tensor, kernels Triton sparse-MLA portados y una poda determinista del 15% de expertos para ajustar los pesos AWQ-INT4. Un hallazgo crítico es que las instrucciones originales de construcción de la imagen Docker están incompletas, requiriendo la reconstrucción de parches faltantes para deep_gemm.py y sparse_attn_indexer.py. El autor también identificó que usar cualquier versión de vLLM distinta al commit específico fijado provoca que los pesos AWQ reales fallen durante la carga debido a errores de CUDA. Para replicar el entorno, los usuarios deben aplicar un script personalizado que incorpore kernels y funciones de enrutamiento a fallbacks sm12x. Los beneficios de rendimiento incluyen aproximadamente el doble de velocidad de las implementaciones anteriores de llama.cpp, aunque el ancho de banda entre nodos sigue siendo un cuello de botella para la escalabilidad dual-rail.
GLM-5.2 en 4x DGX Spark: Reconstrucción de pasos de compilación faltantes para descodificación especulativa MTP
LordNeel lanza cuantizaciones GGUF para Tencent Hy3 y NVIDIA Nemotron-Labs-Audex
LordNeel ha publicado conjuntos de cuantización GGUF para el modelo MoE Hy3 de 295B de Tencent y el modelo híbrido MoE Nemotron-Labs-Audex-30B-A3B de 30B con capacidades de audio de NVIDIA, proporcionando datos completos de benchmarks y métricas reproducibles.
NVIDIA lanza Puzzle-75B-A9B, un modelo Nemotron comprimido con 2x de rendimiento
NVIDIA ha lanzado el modelo Nemotron-Labs-3-Puzzle-75B-A9B, un modelo de lenguaje grande optimizado para despliegue derivado de Nemotron-3-Super-120B-A12B. Utiliza el marco de compresión post-entrenamiento Iterative Puzzle para mejorar significativamente la eficiencia de inferencia en cargas de trabajo con razonamiento y contexto largo, manteniendo una alta precisión en tareas posteriores.
NVIDIA lanza el modelo Qwen3.6-27B-NVFP4
NVIDIA ha lanzado el modelo Qwen3.6-27B-NVFP4 en Hugging Face.
GLM-5.2 NVFP4 en cuatro DGX Sparks: resuelto el misterio de MTP, ahora ~24 tok/s con contexto de 128K
Una investigación posterior sobre la ejecución de GLM-5.2 NVFP4 en cuatro nodos DGX Spark resuelve un cuello de botella de rendimiento anterior donde las altas tasas de aceptación eran imposibles con un contexto de 128K.
Cuantización GLM-5.2 de alta calidad en 4x DGX Spark - Guía, Resultados y Comparativas
El autor demuestra la ejecución del modelo GLM-5.2 NVFP4 en cuatro nodos NVIDIA GB10 DGX Spark con una ventana de contexto de 128K, logrando un rendimiento de servicio utilizable mediante una optimización agresiva del sistema.