GLM-5.2 UD-IQ2_M funciona a ~7.3 tokens por segundo en 4×RTX 3090s con 192GB de RAM DDR5 usando expert offload de llama.cpp. Reducir la cuantización de IQ2 a IQ1 no proporcionó ganancia de velocidad, mientras que aumentar los hilos de CPU de 6 a 12 mejoró el rendimiento en un 22%. La decodificación está limitada por el cómputo de CPU, no por el ancho de banda de memoria, y los expertos descargados deben distribuirse explícitamente entre las GPUs para evitar errores de falta de memoria.
GLM-5.2 (744B, 2-bit) alcanza 7.3 tok/s en 4×3090 con 192GB de RAM
Z.ai y Alibaba convergen independientemente en una arquitectura de atención lineal 3:1 para GLM-5.3-Flash y Qwen3.8-Flash-Next
Z.ai lanzó GLM-5.3-Flash, un modelo MoE multimodal de 320B parámetros con 18B parámetros activos, mientras que el equipo de Qwen de Alibaba lanzó Qwen3.8-Flash-Next, un modelo de 125B con 6B parámetros activos. A pesar del desarrollo independiente, ambos equipos adoptaron configuraciones arquitecturales casi idénticas.
GLM 5.2 alcanza el 98% de inteligencia máxima con menos de la mitad de tokens
GLM 5.2 demuestra el 98% de su inteligencia máxima en tareas de codificación utilizando menos de la mitad de su presupuesto total de tokens, según un informe técnico de z_ai. La eficiencia de razonamiento del modelo ha mejorado significativamente, con un aumento en el uso de tokens de 16.7k a 36.7k entre GLM 5.1 y GLM 5.2, aunque las configuraciones de alto nivel pueden sobrecargar el rendimiento del hardware local.
Ejecutar GLM-5.2 solo en CPU con configuración local
Un usuario ejecuta GLM-5.2 localmente en un Dell PowerEdge R740 con dos CPUs Xeon 6248R y 768GB de RAM, utilizando ik_llama.cpp para mejorar la inferencia en CPU. Tras aislar un nodo NUMA para un rendimiento óptimo, logran 4–5.5 tokens por segundo en chat y aproximadamente 3 tokens por segundo en tareas de codificación, señalando que el modelo muestra 'sensaciones de frontera' durante la generación de código a pesar de su limitada usabilidad en este hardware.
Configuración de implementación Docker SGLang GLM-5.2-FP8 HGX-H200
Un usuario comparte una configuración de Docker para ejecutar GLM-5.2-FP8 en hardware HGX-H200 utilizando SGLang. La configuración logra una longitud de contexto de 262k y 70 tokens por segundo con paralelismo tensorial de 8, usando una fracción de memoria de 0.83. El usuario señala que las recetas oficiales de vLLM no funcionan en H200 debido a limitaciones de cuantización FP8 del caché KV en la arquitectura DSV3.
GLM 5.2 en 4x Sparks: ¿Razonable?
Un usuario pregunta si es factible ejecutar GLM-5.2 en cuatro chips Ascend GX10 (DGX Sparks). Indaga sobre la cuantización de 4 bits utilizando 512GB de memoria unificada y estima las velocidades de tokens de entrada y salida para una longitud de contexto de 100k, señalando que no hay datos de rendimiento disponibles en línea.