Una publicación en Reddit analiza la configuración de hardware rentable para ejecutar los modelos Qwen 3.6, tanto el de 27B como el de 35B-A3B, señalando que la RTX 3090 de 24GB ofrece mejor valor a largo plazo frente a la Tesla V100 debido a su descontinuación y las alternativas chinas próximas. La configuración propuesta suma $1,995.65, incluyendo un Ryzen 5 5600X, una RTX 3090 de 24GB y componentes esenciales, siendo el precio total una preocupación clave para los usuarios que buscan asequibilidad.
Hardware más económico para Qwen 3.6: modelos de 27B y 35B-A3B
qwen4exp añade soporte de reversión de estado recurrente para descodificación especulativa MTP
El proyecto qwen4exp ha implementado soporte de reversión de estado recurrente para habilitar la descodificación especulativa con predicción multi-tokens (MTP) efectiva. Este cambio permite que el estado objetivo retroceda en el número de tokens borrador rechazados, evitando la serialización innecesaria de todo el estado recurrente a la memoria del host.
Qwen3.6 35B-A3B genera un simulador de vuelo en un solo prompt
Un usuario de Reddit demostró que Qwen3.6 35B-A3B genera un simulador de vuelo completo y relajante con montañas, nubes y terreno procedural infinito a partir de un único prompt.
Rendimiento local de Qwen 27B en hardware de consumo
Un usuario informa que Qwen 27B, cuantizado a q6kxl y ejecutado con predicción de múltiples tokens en un sistema con GPUs 4090 y 3090, alcanza velocidades de decodificación de 50-90 tokens/s y velocidades de prellenado de 1500-2200 tokens/s. El modelo se integra confiablemente con varias APIs y genera código funcional para aplicaciones de una sola página, documentos LaTeX, analizadores y rastreadores.
Mejores configuraciones para 48GB VRAM con Qwen 3.6 27B
Un usuario comparte configuraciones optimizadas para ejecutar Qwen 3.6 27B con cuantización Q8_0 en una configuración de RTX 4090 y RTX 3090 usando llama.cpp. La configuración incluye tensor split, 999 capas en GPU, contexto de 250k, decodificación especulativa y caché KV unificada, logrando un rendimiento de 75-100t/s con soporte para visión y MTP.
El costo de $1800 en GPU ejecuta Qwen3.6-27B con contexto de 262K y 55 tok/s
Una configuración con cuatro GPUs 5060 Ti (totalizando $1800) logra 55 tokens por segundo con Qwen3.6-27B-FP8, soportando una longitud de contexto de 262K y caché KV bfloat16. La configuración utiliza P2P y FlashInfer, con resultados de benchmark que muestran un rendimiento de salida de 55.67 tokens y una tasa de aceptación de decodificación especulativa del 65.25%.