Un estudio controlado evalúa los modelos OpenPangu 1B y 7B en NPUs Huawei Ascend 910B1 utilizando métodos de cuantización solo de pesos y de pesos-activación. Los resultados muestran que la cuantización solo de pesos de 8 bits es sin pérdidas para ambos modelos, mientras que la cuantización de 4 bits es práctica para el modelo 7B pero perjudicial para el 1B en tareas de razonamiento, matemáticas y código. Los métodos de ultra baja precisión como 2 bits y binarios fallan, y W4A4 SmoothQuant produce una perplejidad no finita, lo que indica que la compresión extrema de pocos bits sigue siendo un desafío.
Estudio empírico de la cuantización OpenPangu en NPUs Ascend
Contributor añade soporte para Gemma 4 y optimizaciones de exportación ONNX a Hugging Face
Un contribuidor está preparando una solicitud de extracción (pull request) para añadir soporte upstream para la familia de modelos Gemma 4 a Hugging Face, junto con optimizaciones para el trazado de exportación ONNX. Los cambios abordan limitaciones específicas de la arquitectura durante el trazado ONNX y corrigen los cálculos de capa para variantes de modelo heterogéneas, incluidas configuraciones de Mezcla de Expertos (MoE) y Denso.
Ornith 35B funciona razonablemente bien con el modelo especulativo Qwen3.6 35B DFlash
Un usuario reporta haber logrado un aumento del 30-40% en la velocidad de generación de tokens al emparejar el modelo Ornith-1.0-35B como modelo borrador con Qwen3.6-35B-A3B-DFlash usando llama-server.
Actualización de Ornith-1.0-35B GGUF: injerto nativo de descodificación especulativa MTP + métricas completas de servicio/TTFT/contexto largo (llama.cpp, tp=1)
Este artículo informa sobre una actualización del modelo Ornith-1.0-35B, que presenta una cabeza de borrador MTP nativa injertada en el cuerpo IQ4_XS para la descodificación especulativa auto-iniciada en llama.cpp. El autor proporciona métricas de rendimiento integrales que incluyen throughput, tiempo hasta el primer token (TTFT) y capacidades de contexto largo en una única GPU RTX PRO 6000 Blackwell.
Cálculos rápidos sobre los costos de alojamiento colectivo para diffusiongemma en 2026
Un análisis de costos estima que alojar diffusiongemma a diferentes niveles de tokens por usuario genera costos mensuales por usuario que oscilan entre 1,7€ y 122,8€. El estudio encuentra que el uso de IA agéntica es económicamente insostenible para el alojamiento colectivo, aunque los costos podrían disminuir con nuevas GPUs o ASICs y un período de depreciación de la GPU más corto.
Solución al descenso abrupto de decodificación de contexto largo en Radeon R9700 con vLLM 0.22.1
Un descenso abrupto en el rendimiento de decodificación de contexto largo en AMD Radeon AI PRO R9700 (RDNA4) fue resuelto habilitando AITER Unified Attention en vLLM 0.22.1. La corrección implica relajar un gate CDNA para incluir RDNA4, deshabilitar otros backends de atención y usar caché KV bf16, lo que resulta en aceleraciones significativas en todas las longitudes de contexto. FP8 KV es ineficaz en este hardware, y el contexto nativo del modelo de 262K se logra completamente con bf16, ofreciendo ~2.9× concurrencia sin necesidad de FP8.