Qwen выпустила открытые веса для своей модели Qwen 3.8 27B. Чекпоинт доступен на Hugging Face.
Qwen выпустила открытые веса для Qwen 3.8 27B
ISTA выпустила GGUF-модели GSQ-RCO для Qwen3.8-Flash-Next и версию Coder с удалением 50% экспертов
Лаборатория глубоких алгоритмов и систем ISTA выпустила квантованные версии в формате GGUF для модели с разреженной смесью экспертов Qwen3.8-Flash-Next, а также экспериментальную сборку, ориентированную на целевые возможности, в которой удалена половина её экспертов.
Quantization-Aware Healing восстанавливает 4-битные LLM быстрее, чем QAT
Авторы представляют Quantization-Aware Healing (QAH), конвейер, который дистиллирует студентов 4-битных моделей непосредственно из несжатых моделей для восстановления производительности, потерянной во время структурного сжатия и квантования. Примененный к GPT-OSS 120B, этот метод производит Hypernova-60B, который соответствует или превосходит источник bfloat16 на 7 из 9 бенчмарков, используя примерно в 4 раза меньше памяти весов.
Quantization-Aware Healing восстанавливает модели LLM на 4 бита быстрее, чем QAT
Авторы представляют Quantization-Aware Healing (QAH), метод восстановления способностей к рассуждению и написанию кода в структурно сжатых больших языковых моделях на 4 бита. В отличие от стандартного обучения с учётом квантования, которое переобучает сжатую модель, QAH дистиллирует студента 4-битной модели напрямую из исходной несжатой модели.
PrismML выпустила Bonsai 27B, сжимая Qwen3.6-27B до 1-битных и тернарных весов
PrismML выпустила Bonsai 27B, квантование с низким битом модели Qwen3.6-27B, которое позволяет запускать большие мультимодальные модели на ноутбуках и телефонах без переобучения.
Qwen3.5 122B A10B в формате UD-Q2_K_XL помещается в 64 ГБ ОЗУ и улучшает внутренние знания
Пользователь демонстрирует, что модель Qwen3.5 122B A10B, квантованная с помощью UD-Q2_K_XL, может поместиться в 64 ГБ системной оперативной памяти, заменяя предыдущий лучший вариант для данного ограничения.