Пользователь делится оптимизированными настройками для запуска Qwen 3.6 27B с квантованием Q8_0 на системе RTX 4090 и RTX 3090 с использованием llama.cpp. Конфигурация включает разбиение тензоров, 999 слоев на GPU, контекст длиной 250k, спекулятивное декодирование и единый кэш КВ, что обеспечивает пропускную способность 75-100t/s с поддержкой визуальных данных и MTP.
Наилучшие настройки для 48 ГБ ОЗУ с Qwen 3.6 27B
Результаты теста производительности квантования Qwen3.6 27B
Тест, сравнивающий версии квантования Q8 и IQ3 XXS turbo4 для Qwen3.6 27B, показывает, что Q8 превосходит в безопасности API и очистке входных данных, в то время как IQ3 XXS turbo4 демонстрирует лучшие результаты в управлении потоками и проектировании модульного кода. Модель рекомендует объединить оба подхода: использовать Q8 для начальной защиты и IQ3 XXS для атомарных записей и жизненного цикла потоков, формируя совместную фундаментальную стадию первого этапа.
ISTA выпустила GGUF-модели GSQ-RCO для Qwen3.8-Flash-Next и версию Coder с удалением 50% экспертов
Лаборатория глубоких алгоритмов и систем ISTA выпустила квантованные версии в формате GGUF для модели с разреженной смесью экспертов Qwen3.8-Flash-Next, а также экспериментальную сборку, ориентированную на целевые возможности, в которой удалена половина её экспертов.
qwen4exp добавляет поддержку отката рекуррентного состояния для спекулятивного декодирования MTP
Проект qwen4exp реализовал поддержку отката рекуррентного состояния, чтобы обеспечить эффективное спекулятивное декодирование с предсказанием нескольких токенов (MTP). Это изменение позволяет целевому состоянию возвращаться на количество отвергнутых черновых токенов, предотвращая ненужную сериализацию всего рекуррентного состояния в память хоста.
Quantization-Aware Healing восстанавливает 4-битные LLM быстрее, чем QAT
Авторы представляют Quantization-Aware Healing (QAH), конвейер, который дистиллирует студентов 4-битных моделей непосредственно из несжатых моделей для восстановления производительности, потерянной во время структурного сжатия и квантования. Примененный к GPT-OSS 120B, этот метод производит Hypernova-60B, который соответствует или превосходит источник bfloat16 на 7 из 9 бенчмарков, используя примерно в 4 раза меньше памяти весов.
Quantization-Aware Healing восстанавливает модели LLM на 4 бита быстрее, чем QAT
Авторы представляют Quantization-Aware Healing (QAH), метод восстановления способностей к рассуждению и написанию кода в структурно сжатых больших языковых моделях на 4 бита. В отличие от стандартного обучения с учётом квантования, которое переобучает сжатую модель, QAH дистиллирует студента 4-битной модели напрямую из исходной несжатой модели.