A NVIDIA lançou o modelo Qwen3.6-27B-NVFP4 no Hugging Face.
O checkpoint agora está disponível para download.
A NVIDIA lançou o modelo Qwen3.6-27B-NVFP4 no Hugging Face.
O checkpoint agora está disponível para download.
Os autores apresentam Quantization-Aware Healing (QAH), um pipeline que destila estudantes de 4 bits diretamente de modelos não comprimidos para recuperar o desempenho perdido durante a compressão estrutural e quantização. Aplicado ao GPT-OSS 120B, este método produz Hypernova-60B, que iguala ou supera a fonte bfloat16 em 7 dos 9 benchmarks enquanto usa aproximadamente 4 vezes menos memória de peso.
Os autores introduzem o Quantization-Aware Healing (QAH), um método para recuperar capacidades de raciocínio e codificação em modelos de linguagem grandes de 4 bits estruturalmente comprimidos. Diferente do treinamento consciente de quantização padrão que re-ajusta o modelo comprimido, o QAH destila o estudante de 4 bits diretamente do modelo original não comprimido.
A NVIDIA demonstrou o serviço do modelo de parâmetros Qwen 3.8 2.4T com capacidades de raciocínio configuráveis em sua plataforma de hardware GB300 NVL72.
A Qwen liberou os pesos abertos para seu modelo Qwen 3.8 27B. O checkpoint está disponível no Hugging Face.
A Alibaba liberou os pesos abertos do Qwen3.8-2.4T-A95B (também conhecido como Qwen3.8-Max), seu maior modelo de pesos abertos, projetado para trazer capacidades próximas às de fronteira para o ecossistema aberto.
Usamos cookies para medir o tráfego e melhorar o site. Você pode aceitar ou recusar os cookies de análise. Política de privacidade