Un usuario pregunta si es factible ejecutar GLM-5.2 en cuatro chips Ascend GX10 (DGX Sparks). Indaga sobre la cuantización de 4 bits utilizando 512GB de memoria unificada y estima las velocidades de tokens de entrada y salida para una longitud de contexto de 100k, señalando que no hay datos de rendimiento disponibles en línea.
GLM 5.2 en 4x Sparks: ¿Razonable?
GLM 5.2 alcanza el 98% de inteligencia máxima con menos de la mitad de tokens
GLM 5.2 demuestra el 98% de su inteligencia máxima en tareas de codificación utilizando menos de la mitad de su presupuesto total de tokens, según un informe técnico de z_ai. La eficiencia de razonamiento del modelo ha mejorado significativamente, con un aumento en el uso de tokens de 16.7k a 36.7k entre GLM 5.1 y GLM 5.2, aunque las configuraciones de alto nivel pueden sobrecargar el rendimiento del hardware local.
GLM-5.2 (744B, 2-bit) alcanza 7.3 tok/s en 4×3090 con 192GB de RAM
GLM-5.2 UD-IQ2_M funciona a ~7.3 tokens por segundo en 4×RTX 3090s con 192GB de RAM DDR5 usando expert offload de llama.cpp. Reducir la cuantización de IQ2 a IQ1 no proporcionó ganancia de velocidad, mientras que aumentar los hilos de CPU de 6 a 12 mejoró el rendimiento en un 22%. La decodificación está limitada por el cómputo de CPU, no por el ancho de banda de memoria, y los expertos descargados deben distribuirse explícitamente entre las GPUs para evitar errores de falta de memoria.
Ejecutar GLM-5.2 solo en CPU con configuración local
Un usuario ejecuta GLM-5.2 localmente en un Dell PowerEdge R740 con dos CPUs Xeon 6248R y 768GB de RAM, utilizando ik_llama.cpp para mejorar la inferencia en CPU. Tras aislar un nodo NUMA para un rendimiento óptimo, logran 4–5.5 tokens por segundo en chat y aproximadamente 3 tokens por segundo en tareas de codificación, señalando que el modelo muestra 'sensaciones de frontera' durante la generación de código a pesar de su limitada usabilidad en este hardware.
Configuración de implementación Docker SGLang GLM-5.2-FP8 HGX-H200
Un usuario comparte una configuración de Docker para ejecutar GLM-5.2-FP8 en hardware HGX-H200 utilizando SGLang. La configuración logra una longitud de contexto de 262k y 70 tokens por segundo con paralelismo tensorial de 8, usando una fracción de memoria de 0.83. El usuario señala que las recetas oficiales de vLLM no funcionan en H200 debido a limitaciones de cuantización FP8 del caché KV en la arquitectura DSV3.
GLM-5.2 Reclama el Primer Puesto en Programación Frontend con Decodificación Especulativa
GLM-5.2, un modelo de 744B parámetros de Z.ai, ha sido evaluado como el mejor modelo de programación frontend a nivel mundial, superando a todas las versiones de Opus, incluyendo Opus 4.8. Este logro se destaca en evaluaciones de terceros que validan las pruebas oficiales offline, marcando un hito significativo para un modelo de su tamaño, particularmente en el competitivo dominio de la programación frontend.