Qwen ha liberado los pesos abiertos para su modelo Qwen 3.8 27B. El checkpoint está disponible en Hugging Face.
Qwen libera los pesos abiertos para Qwen 3.8 27B
ISTA publica GGUFs GSQ-RCO para Qwen3.8-Flash-Next y una versión de Coder con poda del 50% de expertos
El Laboratorio de Algoritmos Profundos y Sistemas de ISTA ha publicado versiones cuantizadas en formato GGUF del modelo de mezcla dispersa de expertos Qwen3.8-Flash-Next, junto con una compilación experimental orientada a capacidades específicas que elimina la mitad de sus expertos.
Quantization-Aware Healing recupera LLMs de 4 bits más rápido que QAT
Los autores presentan Quantization-Aware Healing (QAH), una canalización que destila estudiantes de 4 bits directamente desde modelos sin comprimir para recuperar el rendimiento perdido durante la compresión estructural y cuantización. Aplicado a GPT-OSS 120B, este método produce Hypernova-60B, que iguala o supera al bfloat16 fuente en 7 de 9 benchmarks mientras usa aproximadamente 4 veces menos memoria de peso.
Quantization-Aware Healing recupera LLMs de 4 bits más rápido que QAT
Los autores presentan Quantization-Aware Healing (QAH), un método para recuperar capacidades de razonamiento y codificación en modelos de lenguaje grandes de 4 bits estructuralmente comprimidos. A diferencia del entrenamiento consciente de la cuantización estándar que re-ajusta el modelo comprimido, QAH destila al estudiante de 4 bits directamente desde el modelo original sin comprimir.
PrismML lanza Bonsai 27B, comprimiendo Qwen3.6-27B a pesos de 1 bit y ternarios
PrismML ha lanzado Bonsai 27B, una cuantización de bajo ancho de banda del modelo Qwen3.6-27B que permite ejecutar grandes modelos multimodales en portátiles y teléfonos sin necesidad de reentrenamiento.
Qwen3.5 122B A10B en formato UD-Q2_K_XL cabe en 64 GB de RAM y mejora el conocimiento interno
Un usuario demuestra que Qwen3.5 122B A10B cuantizado con UD-Q2_K_XL puede caber en 64 GB de RAM del sistema, reemplazando la mejor opción anterior para esa restricción.