NVIDIA ha lanzado el modelo Qwen3.6-27B-NVFP4 en Hugging Face.
El checkpoint ya está disponible para su descarga.
NVIDIA ha lanzado el modelo Qwen3.6-27B-NVFP4 en Hugging Face.
El checkpoint ya está disponible para su descarga.
Los autores presentan Quantization-Aware Healing (QAH), una canalización que destila estudiantes de 4 bits directamente desde modelos sin comprimir para recuperar el rendimiento perdido durante la compresión estructural y cuantización. Aplicado a GPT-OSS 120B, este método produce Hypernova-60B, que iguala o supera al bfloat16 fuente en 7 de 9 benchmarks mientras usa aproximadamente 4 veces menos memoria de peso.
Los autores presentan Quantization-Aware Healing (QAH), un método para recuperar capacidades de razonamiento y codificación en modelos de lenguaje grandes de 4 bits estructuralmente comprimidos. A diferencia del entrenamiento consciente de la cuantización estándar que re-ajusta el modelo comprimido, QAH destila al estudiante de 4 bits directamente desde el modelo original sin comprimir.
NVIDIA ha demostrado servir el modelo de parámetros Qwen 3.8 2.4T con capacidades de razonamiento configurables en su plataforma de hardware GB300 NVL72.
Qwen ha liberado los pesos abiertos para su modelo Qwen 3.8 27B. El checkpoint está disponible en Hugging Face.
Alibaba ha liberado los pesos abiertos de Qwen3.8-2.4T-A95B (también conocida como Qwen3.8-Max), su modelo de mayor tamaño con pesos abiertos, diseñado para llevar capacidades cercanas a las de vanguardia al ecosistema abierto.
Usamos cookies para medir el tráfico y mejorar el sitio. Puedes aceptar o rechazar las cookies de analítica. Política de privacidad