A Qwen liberou os pesos abertos para seu modelo Qwen 3.8 27B. O checkpoint está disponível no Hugging Face.
Qwen libera pesos abertos para Qwen 3.8 27B
ISTA lança GGUFs GSQ-RCO para Qwen3.8-Flash-Next e compilação Coder com 50% de especialistas podados
O Laboratório de Algoritmos Profundos e Sistemas da ISTA lançou versões GGUF quantizadas do modelo mistura esparsa de especialistas Qwen3.8-Flash-Next, juntamente com uma compilação experimental voltada a capacidades específicas, com metade de seus especialistas removidos.
Quantization-Aware Healing recupera LLMs de 4 bits mais rápido que QAT
Os autores apresentam Quantization-Aware Healing (QAH), um pipeline que destila estudantes de 4 bits diretamente de modelos não comprimidos para recuperar o desempenho perdido durante a compressão estrutural e quantização. Aplicado ao GPT-OSS 120B, este método produz Hypernova-60B, que iguala ou supera a fonte bfloat16 em 7 dos 9 benchmarks enquanto usa aproximadamente 4 vezes menos memória de peso.
Quantization-Aware Healing recupera LLMs de 4 bits mais rápido que QAT
Os autores introduzem o Quantization-Aware Healing (QAH), um método para recuperar capacidades de raciocínio e codificação em modelos de linguagem grandes de 4 bits estruturalmente comprimidos. Diferente do treinamento consciente de quantização padrão que re-ajusta o modelo comprimido, o QAH destila o estudante de 4 bits diretamente do modelo original não comprimido.
PrismML lança Bonsai 27B, comprimindo Qwen3.6-27B para pesos de 1-bit e ternários
A PrismML lançou o Bonsai 27B, uma quantização de baixa precisão do modelo Qwen3.6-27B que permite executar grandes modelos multimodais em laptops e celulares sem necessidade de retreinamento.
Qwen3.5 122B A10B no formato UD-Q2_K_XL cabe em 64 GB de RAM e melhora o conhecimento interno
Um usuário demonstra que Qwen3.5 122B A10B quantizado com UD-Q2_K_XL pode caber em 64 GB de RAM do sistema, substituindo a melhor opção anterior para essa restrição.