Un usuario comparte configuraciones optimizadas para ejecutar Qwen 3.6 27B con cuantización Q8_0 en una configuración de RTX 4090 y RTX 3090 usando llama.cpp. La configuración incluye tensor split, 999 capas en GPU, contexto de 250k, decodificación especulativa y caché KV unificada, logrando un rendimiento de 75-100t/s con soporte para visión y MTP.
Mejores configuraciones para 48GB VRAM con Qwen 3.6 27B
Resultados de la prueba de rendimiento de cuantización de Qwen3.6 27B
Una prueba que compara las versiones cuantizadas Q8 e IQ3 XXS turbo4 de Qwen3.6 27B muestra que Q8 destaca en seguridad de API y sanitización de entradas, mientras que IQ3 XXS turbo4 tiene un mejor desempeño en gestión de hilos y diseño de código modular. El modelo recomienda combinar ambos enfoques: usar Q8 para la protección inicial al inicio e IQ3 XXS para escrituras atómicas y ciclo de vida de los hilos, formando una base combinada de Fase 1.
Alibaba anuncia Qwen 3.8 Max, un modelo de 2.4T parámetros con pesos abiertos que llegará la próxima semana
El equipo de Qwen de Alibaba ha anunciado Qwen 3.8 Max, un nuevo modelo insignia de 2.4T parámetros centrado en codificación, trabajo agénico a largo plazo y razonamiento multimodal. La compañía confirmó que las versiones de pesos abiertos tanto de Qwen 3.8 Max como del más pequeño Qwen 3.8-27B se lanzarán la próxima semana.
Lanzamiento de peso abierto de Qwen3.8, Kimi Code CLI, pila LLM de Netflix, software de chip de Alibaba
Alibaba anunció el lanzamiento de peso abierto de Qwen3.8, un modelo de 2,4 billones de parámetros, mientras también liberaba como código abierto su pila de software del chip AI Zhenwu para reducir la dependencia del ecosistema CUDA de Nvidia.
PrismML lanza Bonsai 27B, comprimiendo Qwen3.6-27B a pesos de 1 bit y ternarios
PrismML ha lanzado Bonsai 27B, una cuantización de bajo ancho de banda del modelo Qwen3.6-27B que permite ejecutar grandes modelos multimodales en portátiles y teléfonos sin necesidad de reentrenamiento.
Qwen3.5 122B A10B en formato UD-Q2_K_XL cabe en 64 GB de RAM y mejora el conocimiento interno
Un usuario demuestra que Qwen3.5 122B A10B cuantizado con UD-Q2_K_XL puede caber en 64 GB de RAM del sistema, reemplazando la mejor opción anterior para esa restricción.