Тест, сравнивающий версии квантования Q8 и IQ3 XXS turbo4 для Qwen3.6 27B, показывает, что Q8 превосходит в безопасности API и очистке входных данных, в то время как IQ3 XXS turbo4 демонстрирует лучшие результаты в управлении потоками и проектировании модульного кода. Модель рекомендует объединить оба подхода: использовать Q8 для начальной защиты и IQ3 XXS для атомарных записей и жизненного цикла потоков, формируя совместную фундаментальную стадию первого этапа.
Результаты теста производительности квантования Qwen3.6 27B
Наилучшие настройки для 48 ГБ ОЗУ с Qwen 3.6 27B
Пользователь делится оптимизированными настройками для запуска Qwen 3.6 27B с квантованием Q8_0 на системе RTX 4090 и RTX 3090 с использованием llama.cpp. Конфигурация включает разбиение тензоров, 999 слоев на GPU, контекст длиной 250k, спекулятивное декодирование и единый кэш КВ, что обеспечивает пропускную способность 75-100t/s с поддержкой визуальных данных и MTP.
Alibaba анонсировала Qwen 3.8 Max — модель с 2,4 трлн параметров и открытыми весами, которая выйдет на следующей неделе
Команда Qwen от Alibaba объявила о выпуске Qwen 3.8 Max, новой флагманской модели с 2,4 трлн параметров, ориентированной на программирование, долгосрочную автономную работу агентов и мультимодальное рассуждение. Компания подтвердила, что на следующей неделе будут выпущены версии с открытыми весами как для Qwen 3.8 Max, так и для более компактной модели Qwen 3.8-27B.
Выход Qwen3.8 с открытыми весами, CLI для Kimi Code, стек LLM от Netflix, программное обеспечение для чипов Alibaba
Alibaba объявила о выпуске модели Qwen3.8 с открытыми весами, содержащей 2,4 триллиона параметров, а также об открытии исходного кода стека программного обеспечения для своего ИИ-чипа Zhenwu, чтобы снизить зависимость от экосистемы CUDA от Nvidia.
PrismML выпустила Bonsai 27B, сжимая Qwen3.6-27B до 1-битных и тернарных весов
PrismML выпустила Bonsai 27B, квантование с низким битом модели Qwen3.6-27B, которое позволяет запускать большие мультимодальные модели на ноутбуках и телефонах без переобучения.
Qwen3.5 122B A10B в формате UD-Q2_K_XL помещается в 64 ГБ ОЗУ и улучшает внутренние знания
Пользователь демонстрирует, что модель Qwen3.5 122B A10B, квантованная с помощью UD-Q2_K_XL, может поместиться в 64 ГБ системной оперативной памяти, заменяя предыдущий лучший вариант для данного ограничения.