Un usuario de Reddit llamado Intrepid_Rub_3566 ha compartido una reseña en video que evalúa el rendimiento de GLM 5.2 ejecutándose en una configuración dual AMD Strix Halo con 256GB de RAM. La discusión se centra en si esta configuración específica de hardware proporciona suficiente valor para la inferencia de modelos de lenguaje grandes locales. El contenido destaca la viabilidad técnica de desplegar GLM 5.2 en dicho entorno, enfocándose en la utilización de recursos y velocidad. Los espectadores son dirigidos a un enlace de YouTube para obtener benchmarks detallados y métricas de rendimiento. La discusión también incluye comentarios de la comunidad sobre la practicidad y rentabilidad de este enfoque con doble GPU.
GLM 5.2 en Dual Strix Halo (256GB): ¿Vale la pena?
Rendimiento de GLM5.2
Un usuario de Reddit está recopilando datos de velocidad de inferencia para la checkpoint nvfp4 de 460GB de GLM5.2 de Nvidia de la comunidad.
GLM5.2 en 5x Pro 6000s y un 5090, un viaje costoso
Un usuario detalla su extenso proceso de actualización de hardware para ejecutar el modelo GLM 5.2 localmente, culminando en una configuración con cinco GPUs AMD Radeon Pro W6800 y una NVIDIA RTX 5090.
llama.cpp b10306 añade ruta plana de GLU SYCL y consolida kernels
La versión b10306 de llama.cpp introduce optimizaciones de rendimiento para el backend SYCL, específicamente dirigidas a las operaciones de Unidad Lineal con Puerta (GLU). La actualización añade una ruta rápida contigua para las operaciones GLU fusionadas y consolida kernels previamente distintos para compartir un lanzador común.
llama.cpp b10255 extiende oneDNN SDPA a cachés KV no FP16
La versión b10255 de llama.cpp extiende la ruta de SDPA de oneDNN para admitir cachés de clave-valor (KV) no FP16, incluidos los formatos cuantizados Q4_0–Q8_0 y FP32. Esta actualización permite que el kernel sistólico fusionado se ejecute idénticamente a la ruta nativa FP16, desquantizando o convirtiendo los tensores K/V a FP16 denso en el dispositivo antes del procesamiento.
Lucebox y AMD superan a Nvidia DGX Spark por 3.63x en DeepSeek V4 Flash
Lucebox se ha asociado con AMD para demostrar una configuración de hardware heterogénea para consumidores que supera a Nvidia DGX Spark en velocidad de inferencia. El sistema combina una GPU AMD Radeon AI PRO R9700 con un procesador Strix Halo para ejecutar el modelo completo DeepSeek V4 Flash de 284B.