Пост на Reddit обсуждает экономичное железо для запуска моделей Qwen 3.6, как 27B, так и 35B-A3B, отмечая, что RTX 3090 24GB обеспечивает лучшее долгосрочное значение по сравнению с Tesla V100 из-за прекращения производства и появления китайских аналогов. Предлагаемая сборка составляет 1995,65 долларов, включая Ryzen 5 5600X, RTX 3 24GB и необходимые компоненты, с общей стоимостью, которая является ключевой проблемой для пользователей, стремящихся к доступности.
Самый дешевый железо для Qwen 3.6: модели 27B и 35B-A3B
qwen4exp добавляет поддержку отката рекуррентного состояния для спекулятивного декодирования MTP
Проект qwen4exp реализовал поддержку отката рекуррентного состояния, чтобы обеспечить эффективное спекулятивное декодирование с предсказанием нескольких токенов (MTP). Это изменение позволяет целевому состоянию возвращаться на количество отвергнутых черновых токенов, предотвращая ненужную сериализацию всего рекуррентного состояния в память хоста.
Qwen3.6 35B-A3B генерирует авиасимулятор в одном промпте
Пользователь Reddit продемонстрировал, как Qwen3.6 35B-A3B генерирует полноценный расслабляющий авиасимулятор с горами, облаками и бесконечным процедурным ландшафом из одного промпта.
Локальная производительность Qwen 27B на потребительском оборудовании
Пользователь сообщает, что Qwen 27B, квантованный до q6kxl и работающий с многозадачным предсказанием токенов на системе с GPU 4090 и 3090, достигает скорости декодирования 50-90 токенов/с и скорости предварительного заполнения 1500-2200 токенов/с. Модель надежно взаимодействует с различными API и генерирует функциональный код для одностраничных приложений, документов LaTeX, парсеров и краулеров.
Наилучшие настройки для 48 ГБ ОЗУ с Qwen 3.6 27B
Пользователь делится оптимизированными настройками для запуска Qwen 3.6 27B с квантованием Q8_0 на системе RTX 4090 и RTX 3090 с использованием llama.cpp. Конфигурация включает разбиение тензоров, 999 слоев на GPU, контекст длиной 250k, спекулятивное декодирование и единый кэш КВ, что обеспечивает пропускную способность 75-100t/s с поддержкой визуальных данных и MTP.
Стоимость в $1800 GPU позволяет запустить Qwen3.6-27B с контекстом в 262K и скоростью 55 ток/с
Настройка, использующая четыре видеокарты 5060 Ti (итого $1800), обеспечивает скорость 55 токенов в секунду при использовании Qwen3.6-27B-FP8, поддерживая длину контекста 262K и кэш KV в формате bfloat16. Конфигурация использует P2P и FlashInfer, при этом результаты тестирования показывают пропускную способность 55,67 токенов на выход и процент принятия спекулятивного декодирования в 65,25%.