Un usuario comparte configuraciones optimizadas para ejecutar Qwen 3.6 27B con cuantización Q8_0 en una configuración de RTX 4090 y RTX 3090 usando llama.cpp. La configuración incluye tensor split, 999 capas en GPU, contexto de 250k, decodificación especulativa y caché KV unificada, logrando un rendimiento de 75-100t/s con soporte para visión y MTP.
Mejores configuraciones para 48GB VRAM con Qwen 3.6 27B
Resultados de la prueba de rendimiento de cuantización de Qwen3.6 27B
Una prueba que compara las versiones cuantizadas Q8 e IQ3 XXS turbo4 de Qwen3.6 27B muestra que Q8 destaca en seguridad de API y sanitización de entradas, mientras que IQ3 XXS turbo4 tiene un mejor desempeño en gestión de hilos y diseño de código modular. El modelo recomienda combinar ambos enfoques: usar Q8 para la protección inicial al inicio e IQ3 XXS para escrituras atómicas y ciclo de vida de los hilos, formando una base combinada de Fase 1.
ISTA publica GGUFs GSQ-RCO para Qwen3.8-Flash-Next y una versión de Coder con poda del 50% de expertos
El Laboratorio de Algoritmos Profundos y Sistemas de ISTA ha publicado versiones cuantizadas en formato GGUF del modelo de mezcla dispersa de expertos Qwen3.8-Flash-Next, junto con una compilación experimental orientada a capacidades específicas que elimina la mitad de sus expertos.
qwen4exp añade soporte de reversión de estado recurrente para descodificación especulativa MTP
El proyecto qwen4exp ha implementado soporte de reversión de estado recurrente para habilitar la descodificación especulativa con predicción multi-tokens (MTP) efectiva. Este cambio permite que el estado objetivo retroceda en el número de tokens borrador rechazados, evitando la serialización innecesaria de todo el estado recurrente a la memoria del host.
Quantization-Aware Healing recupera LLMs de 4 bits más rápido que QAT
Los autores presentan Quantization-Aware Healing (QAH), una canalización que destila estudiantes de 4 bits directamente desde modelos sin comprimir para recuperar el rendimiento perdido durante la compresión estructural y cuantización. Aplicado a GPT-OSS 120B, este método produce Hypernova-60B, que iguala o supera al bfloat16 fuente en 7 de 9 benchmarks mientras usa aproximadamente 4 veces menos memoria de peso.
Quantization-Aware Healing recupera LLMs de 4 bits más rápido que QAT
Los autores presentan Quantization-Aware Healing (QAH), un método para recuperar capacidades de razonamiento y codificación en modelos de lenguaje grandes de 4 bits estructuralmente comprimidos. A diferencia del entrenamiento consciente de la cuantización estándar que re-ajusta el modelo comprimido, QAH destila al estudiante de 4 bits directamente desde el modelo original sin comprimir.